Cloud Intelligence™Cloud Intelligence™

Announcement

Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.

Was jedes Modell hinter Ihrem Requesty-Gateway wirklich kostet

Verbinden Sie Ihre Requesty-Organisation mit Cloud Intelligence™ und sehen Sie Ihre LLM-Ausgaben pro Modell, Hosting-Provider, API-Key und Routing-Richtlinie – bewertet zu dem Preis, den Sie für Credits zahlen, direkt neben Ihren übrigen Cloud-Ausgaben

Ein LLM-Gateway ist gerade deshalb nützlich, weil es Dinge vor Ihrer Anwendung verbirgt: welcher Provider die Anfrage bedient hat, welche Region, welcher Fallback griff, als der primäre Provider ans Rate-Limit stieß. Genau das wollen Sie im Request-Pfad – aber nicht auf der Rechnung. Requesty zieht jede Anfrage zum Listenpreis des Providers von einem vorausbezahlten Credit-Guthaben ab und berechnet seine 5 % beim Aufladen. Die Werte pro Anfrage im Requesty-Dashboard liegen also 5 % unter dem, was die Finanzabteilung tatsächlich bezahlt hat. Die Nutzung wird nach Modellname erfasst, sodass gpt-6-astra von OpenAI und gpt-6-astra von Azure unter einem Label landen, sofern Sie nicht zusätzlich nach Provider aufschlüsseln. Herauszufinden, was ein Team letzten Monat für Claude über Bedrock im Vergleich zu Vertex ausgegeben hat, bedeutet: ein Export, ein Spreadsheet und ein Kreditkartenauszug.

Cloud Intelligence™ liest die Nutzung jetzt direkt aus Ihrer Requesty-Organisation und bewertet jede Zeile genauso wie Ihre Rechnung. Der Report, der zeigt, was Ihr EKS-Cluster gestern gekostet hat, kann jetzt auch zeigen, was er über Requesty für Tokens ausgegeben hat – bis hinunter zum API-Key und zur Routing-Richtlinie, die das Modell ausgewählt hat.

Das bekommen Sie

Tägliche Ausgaben und Token-Nutzung für jedes Modell, das Ihre Requesty-Organisation genutzt hat, als vollwertiger Provider in Cloud Analytics importiert. Die SKU setzt sich aus Hosting-Provider plus Modell zusammen, sodass openai/gpt-6-astra und azure/gpt-6-astra getrennt bleiben und bedrock/claude-haiku-4-5@us-east-1 eine eigene Zeile ist. Labels liefern den Hosting-Provider, den API-Key, die Requesty-Organisation und die Routing-Richtlinie, wenn eine Fallback-, Load-Balancing- oder Latenz-Richtlinie das Modell ausgewählt hat und nicht Ihr Code. Input-Tokens, Output-Tokens und die Anzahl der Anfragen kommen als Metriken mit.

Die Zahlen bedeuten genau das, was die Finanzabteilung darunter versteht. Die Kosten entsprechen den abgezogenen Credits plus Requestys 5 % Aufschlag und stimmen damit mit den Credits überein, die Sie kaufen. Die Listenkosten entsprechen dem Listenpreis des Providers und stimmen mit dem Analytics-Dashboard von Requesty überein. In einer Testorganisation haben wir beide Werte auf den Cent genau mit der Guthabenabbuchung abgeglichen. Bring-your-own-key-Anfragen werden direkt vom Upstream-Provider abgerechnet und werden hier daher mit null Kosten geführt, um Doppelzählungen mit Ihrem OpenAI- oder AWS-Feed zu vermeiden; ihre geschätzten Provider-Ausgaben werden als separate Metrik genai.cost.byok_external geführt.

Da Requesty als reguläre Kosten- und Nutzungsquelle eingebunden wird, funktioniert alles Nachgelagerte wie gewohnt: Reports, Budgets, Anomalieerkennung, Prognosen und das GenAI-Intelligence-Dashboard, in dem Requesty neben OpenRouter, Anthropic, OpenAI, Fireworks AI und Ihren übrigen Inferenz-Ausgaben erscheint.

Das Setup ist bewusst unspektakulär. Sie erstellen einen API-Key in der Requesty Console mit der Berechtigung Manage auf Read und Completions auf None, wählen einen Namen für die Verbindung – fertig. Setzen Sie für diesen Key außerdem ein kleines monatliches Ausgabenlimit; Cloud Intelligence™ liest ausschließlich Nutzungsdaten und sendet nie Inferenz-Anfragen. Bei der ersten Verbindung importieren wir bis zu 12 Monate Historie und aktualisieren danach alle 6 Stunden, sobald Requesty den jeweiligen UTC-Tag abschließt.

So starten Sie

  1. Erstellen Sie einen Management-API-Key in der Requesty Console mit Manage: Read, Completions: None und einem monatlichen Ausgabenlimit.
  2. Verbinden Sie Ihre Requesty-Organisation in Cloud Intelligence™ unter Data ingestion and integrations > Integrations und führen Sie Test connection aus.
  3. Erstellen Sie einen Report, gruppiert nach SKU oder nach den Labels Provider, API key und Routing policy, sobald die Import-E-Mail eintrifft. Die Requesty-Reporting-Dimensionen zeigen, was wohin gemappt wird.
  4. Öffnen Sie das GenAI-Intelligence-Dashboard, um Requesty neben Ihren anderen GenAI-Providern zu sehen.

Der Requesty-Connector ist [CONFIRM: ab sofort für alle Cloud Intelligence™-Kunden verfügbar] und nach OpenRouter, LiteLLM und Bifrost das vierte LLM-Gateway, das wir unterstützen. Wenn Sie Requesty produktiv einsetzen, verbinden Sie es und sagen Sie uns, wo die Zahlen von Ihrer Rechnung abweichen. Gerade Bring-your-own-key-Traffic hat bisher nur unsere Testorganisation gesehen – echtes Volumen aus einer echten Organisation ist genau das, was wir als Nächstes brauchen. Ihr Account Manager oder eine Expertenanfrage ist der schnellste Weg.

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis