Cloud Intelligence™
AI Cost Management: Wie Gartners CFM-Kriterien mit den AI-Ausgaben Schritt halten
AI Cost Management wendet Gartners CFM-Kriterien – finanzielles Risiko, Forecasting, Effizienz, Accountability – auf Token- und GPU-Ausgaben an.
Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.
About Josh Palmer
I'm Josh Palmer, Head of Content at DoiT, where I split my time across multiple business units including DoiT Cloud Intelligence, PerfectScale (Kubernetes cost optimization), and SELECT (Snowflake, Databricks, and BigQuery cost optimization). Before DoiT, I spent four and a half years at OnBoard building content for a board intelligence platform used by 6,000+ organizations, and before that, two years as Content Marketing Manager at Zylo, a SaaS management platform.
My personal pageTL;DR: AI Cost Management umfasst das Messen, Zuordnen, Prognostizieren und Optimieren der Ausgaben einer Organisation für AI- und LLM-Workloads: Tokens, GPU-Compute, Inferenz und die zugehörige Infrastruktur. Es ist keine eigene Disziplin neben dem Cloud Financial Management (CFM), sondern vielmehr dessen Erweiterung.
Was ist AI Cost Management?
AI Cost Management bezeichnet die Praktiken und Tools, die die Ausgaben einer Organisation für AI – Modell-API-Aufrufe, GPU-Infrastruktur, agentische Workloads – mit den Teams, Produkten und Ergebnissen verknüpfen, die diese Ausgaben verursachen. Das Ziel ist dasselbe, das FinOps vor einem Jahrzehnt für die Cloud-Infrastruktur definiert hat: Finance und Engineering ein gemeinsames, präzises Bild der Ausgaben zu geben, damit beide auf Basis derselben Zahlen entscheiden – statt dass Finance eine Rechnung sieht und Engineering eine Blackbox.
Dass AI Cost Management als eigene Kategorie diskutiert wird – und nicht einfach als "Cloud-FinOps, nur für AI" – liegt daran, wie anders sich AI-Infrastruktur verhält. Cloud-Ausgaben sind vergleichsweise stabil: Eine Instanz hat einen Owner, eine Rechnung eine Ressourcen-ID, ein Tag übersteht den Weg vom Provisioning bis zur Rechnung. AI-Workloads hebeln gleich mehrere dieser Annahmen auf einmal aus. Ein gemeinsam genutzter Modell-API-Account kann ein Dutzend Teams über eine einzige Rechnungsposition bedienen. Ein LLM-Gateway kann die Identität des Aufrufers entfernen, bevor eine Anfrage den Anbieter überhaupt erreicht. Eine agentische Pipeline kann über Nacht Sub-Agenten starten, die echte Infrastrukturkosten auslösen, für die niemand instrumentiert hat – weil niemand mit diesem Aufrufmuster gerechnet hat.
Genau diese Lücke soll AI Cost Management schließen: die Disziplin von Kostenzuordnung, Forecasting, Optimierung und Governance auf Workloads anzuwenden, die sich schneller verändern und stärker gemeinsam genutzt werden als die Infrastruktur, für die FinOps ursprünglich entwickelt wurde.
Warum weitet Gartner die Kriterien für Cloud Financial Management auf AI aus?
Gartners Magic Quadrant für Cloud Financial Management Tools fragt bereits heute, ob ein Anbieter vier Dinge beherrscht: finanzielle Risiken managen, Ausgaben prognostizieren, Effizienz steigern und Verantwortlichkeit erhöhen. Keine dieser Pflichtfähigkeiten ist neu, und keine ist per Definition AI-spezifisch. Was sich ändert, ist der Umfang der Workloads, die sie abdecken müssen.
Das Signal auf der Nachfrageseite ist unübersehbar. Der State of FinOps 2026 Report der FinOps Foundation, basierend auf einer Umfrage unter knapp 1.200 Praktikern, die zusammen mehr als 83 Milliarden US-Dollar an jährlichen Cloud-Ausgaben verantworten, ergab: 98 % der FinOps-Teams managen inzwischen AI-Ausgaben – nach 63 % im Jahr 2025 und nur 31 % im Jahr 2024. AI Cost Management ist die Kompetenz, die FinOps-Teams im kommenden Jahr am dringendsten aufbauen wollen. Und auf die Frage, welche Tooling-Fähigkeit sie sich am meisten wünschen, die es noch nicht gibt, lautete die häufigste Antwort: granulares Monitoring von AI-Ausgaben – Tokens, LLM-Anfragen und GPU-Auslastung. Innerhalb von drei Jahren wurden AI-Ausgaben von einem Rundungsfehler zu etwas, wofür fast jedes FinOps-Team verantwortlich ist – ohne eine Tooling-Kategorie, die eigens dafür entwickelt wurde.
Auch Gartners eigener Research-Kalender weist in dieselbe Richtung. Eine Session auf der Gartner IT Infrastructure, Operations & Cloud Strategies Conference im Dezember 2026 in Tokio bezeichnet die Untersuchung bereits als "Magic Quadrant for Cloud and AI Financial Management Tools", kurz CAIFM, und verknüpft diese Umbenennung damit, dass Anbieter "zunehmend an mehr als nur Cloud-Ausgaben gemessen werden" – insbesondere daran, wie gut sie das Kostenmanagement und die Optimierung speziell von AI-Workloads ermöglichen. Das ist eine Bestätigung unter mehreren, nicht der ganze Beweis – aber sie deckt sich mit dem, was Praktiker bereits vor Ort beobachten.
Im Klartext: Die Kriterien, mit denen Gartner CFM-Tools bereits bewertet, werden nicht ersetzt. Sie müssen künftig eine Ausgabenkategorie abdecken, die es in nennenswertem Umfang noch gar nicht gab, als die meisten dieser Tools entwickelt wurden.
Was gehört konkret zum AI Cost Management?
Auf AI-Workloads angewendet, ergeben Gartners vier verpflichtende CFM-Fähigkeiten ein recht einheitliches operatives Vorgehen – eines, das auch die FinOps Foundation in ihrer eigenen FinOps-for-AI-Arbeit ähnlich beschreibt.
Messen. Erfassen Sie die Nutzung auf der Ebene, auf der AI tatsächlich abgerechnet wird: Tokens, nicht Instanzstunden. Input-Tokens, Output-Tokens, gecachte Tokens und Reasoning-Tokens werden je nach Anbieter unterschiedlich bepreist – die Messung muss also auf Request-Ebene erfolgen, nicht auf Account-Ebene.
Zuordnen. Ordnen Sie diese Nutzung einem Owner, einem Team, einem Produkt-Feature, einem Kunden zu – dasselbe Accountability-Ziel, das Showback und Chargeback schon immer verfolgt haben, angewendet auf Workloads, bei denen Tagging häufig versagt. Gemeinsam genutzte GPU-Cluster und LLM-Gateways entfernen oder verschleiern regelmäßig genau das Signal, auf das klassisches Tagging angewiesen ist.
Optimieren. Leiten Sie Anfragen an die richtige Modellstufe für die jeweilige Aufgabe – kleiner und günstiger für Klassifikation und Extraktion, größer und teurer für Aufgaben, die tatsächlich Reasoning-Tiefe erfordern – und nutzen Sie Hebel wie Prompt-Caching und Batch-Verarbeitung, wo es die Latenz erlaubt. Das ist das AI-Pendant zu Right-Sizing und Commitment-Management in der klassischen Cloud-Kostenoptimierung.
Steuern. Definieren Sie Budgets, Alerts und Guardrails zur Laufzeit: harte Limits für die Tool-Call-Tiefe von Agenten, Token-Budgets pro Team, Anomalieerkennung, die darauf abgestimmt ist, wie AI-Ausgaben tatsächlich in die Höhe schnellen. Ein klassischer monatlicher Reporting-Zyklus kann eine AI-Kostenspitze um Tage verpassen; agentische Workloads können Ausgaben innerhalb von Stunden vervielfachen.
Wert nachweisen. Übersetzen Sie rohe Ausgaben in eine Kennzahl, mit der das Business arbeiten kann: Kosten pro Inferenz, Kosten pro erfolgreicher Aufgabe, Kosten pro Kunde. Das ist die AI-Cost-Management-Variante der Unit Economics – und der Schritt, mit dem sich die meisten FinOps-for-AI-Programme nach wie vor schwertun, vor allem weil die Messschicht darunter noch nicht solide ist.

Wie groß ist das Problem der AI-Kostenüberschreitungen wirklich?
Größer, als die meisten FinOps-Teams erwartet hatten. Eine von DoiT in Auftrag gegebene und im Februar 2026 von Sapio Research unabhängig durchgeführte Umfrage unter 500 Finance-Verantwortlichen in Organisationen, die bereits in AI investieren, ergab: AI macht im Schnitt 17,6 % der gesamten Technologieausgaben aus. Dennoch hatten 79 % der Befragten in den vergangenen 12 Monaten AI-bedingte Kostenüberschreitungen erlebt, und nur 15 % konnten den AI-ROI ohne erhebliche Engpässe berechnen.
Das kontraintuitivste Ergebnis dieser Daten: Organisationen, die ihre eigene FinOps-Praxis als sehr ausgereift oder führend einstufen, verzeichneten mit 89 % die höchste Überschreitungsquote. Das ist kein Beleg dafür, dass ausgereifte Governance versagt. Wahrscheinlicher ist, dass diese Organisationen größere, komplexere AI-Initiativen betreiben und über die nötige Transparenz verfügen, um Überschreitungen überhaupt zu erkennen, die weniger reife Teams schlicht übersehen. Reife macht das Problem sichtbar. Die zugrunde liegende Messlücke verschwindet dadurch aber nicht von selbst.
Genau diese Lücke will AI Cost Management schließen – und mit ihm die Kriterien, die Gartner gerade erweitert.
Cloud bill shouldn't be a mystery
One platform for AI and Cloud optimization.
Worauf sollten Sie bei einem AI-Cost-Management-Tool achten?
Gartners bestehende CFM-Checkliste – konfigurierbare Dashboards, Anomalieerkennung, AI-gestützte Analysen, Auslastungsmonitoring, Budgetkontrollen, Ressourcenoptimierung und Remediation-Workflows – gilt weiterhin. Darüber hinaus trennen einige AI-spezifische Anforderungen die Tools, die AI-Kosten wirklich managen, von denen, die nachträglich lediglich eine Position dafür ergänzt haben.
Granularität auf Token- und GPU-Ebene. Reporting auf Account- oder selbst Service-Ebene reicht nicht aus. Sie brauchen Transparenz über Input-, Output-, gecachte und Reasoning-Tokens, aufgeschlüsselt nach Modell und Anbieter – nicht nur eine pauschale API-Rechnung.
Anbieterübergreifende Attribution. Die meisten Unternehmen setzen auf mehr als einen Modellanbieter – Anthropic, OpenAI, Google Gemini, AWS Bedrock – und das oft gleichzeitig. Ein Tool, das nur das Usage-Dashboard eines einzigen Anbieters abdeckt, erzeugt genau den Tool-Wildwuchs, den Multi-Cloud-FinOps für Infrastruktur ein Jahrzehnt lang beseitigt hat.
Abdeckung für gemeinsam genutzte und agentische Infrastruktur. Fragen Sie konkret, wie ein Tool Kosten zuordnet, wenn eine Anfrage über ein LLM-Gateway läuft oder wenn ein Agent Sub-Agenten startet, die Kosten außerhalb des ursprünglichen Aufrufs auslösen. Hängt die Antwort vollständig an Tags oder SDK-Instrumentierung, fragen Sie nach, was mit den Ausgaben passiert, deren Zuordnung durch eine Infrastrukturänderung wegbricht, bevor das Engineering nachziehen kann.
Unit Economics statt bloßer Ausgabensummen. Kosten pro Inferenz, Kosten pro Kunde, Kosten pro Feature. Ein Dashboard, das nur zeigt, was ausgegeben wurde – ohne einen Weg zu dem, was diese Ausgaben erbracht haben –, löst nur die Hälfte des Problems.
Attribution mit geringem Aufwand. Instrumentierung, die darauf angewiesen ist, dass jedes Team jede Anfrage dauerhaft korrekt taggt, verliert in der Regel in dem Moment an Zuverlässigkeit, in dem sich Nutzungsmuster verschieben. Ansätze, die den Verbrauch auf Infrastrukturebene messen – statt darauf zu setzen, dass Tags den Weg vom Request bis zur Rechnung überstehen –, halten besser stand, während sich AI-Architekturen schneller verändern, als die meisten Engineering-Teams sie dokumentieren können.
Wie sieht das bei den verschiedenen Modellanbietern aus?
Die anbieterspezifischen Pricing-Guides im DoiT-Blog kommen aus unterschiedlichen Blickwinkeln zum selben Schluss – und genau darum geht es: Das ist kein Anthropic-Problem, kein Bedrock-Problem und kein OpenAI-Problem. Es ist dieselbe Messlücke, die sich in drei unterschiedlichen Abrechnungsstrukturen zeigt.
Anthropics Claude-Modelle bepreisen Input- und Output-Tokens getrennt nach Stufe (Haiku, Sonnet, Opus). Ein einzelner agentischer Workflow kann seine Kosten also deutlich verschieben – je nachdem, welche Stufe welchen Schritt übernimmt, ob Prompt-Caching im Spiel ist und ob Anfragen über ein gemeinsames Gateway laufen. Amazon Bedrock fügt eine zweite Achse hinzu: On-Demand, Provisioned Throughput und Batch-Inferenz bringen unterschiedliche Trade-offs zwischen Kosten und Latenz mit sich, und allein die Modellauswahl kann die Token-Preise innerhalb derselben Modellfamilie um das 10- bis 20-Fache verschieben. Die Usage- und Kostenintegration für OpenAI existiert aus demselben Grund: Das Attributionsproblem verschwindet nicht, nur weil der Anbieter wechselt.
Die meisten Unternehmen nutzen mehrere dieser Anbieter gleichzeitig, oft innerhalb derselben Anwendung – genau deshalb steht die anbieterübergreifende Attribution oben auf der Checkliste. Ein CFM-Tool, das nur das Usage-Dashboard eines Anbieters abdeckt, schließt den blinden Fleck nicht – es verlagert ihn nur. DoiT arbeitet über alle drei hinweg – über seine Anthropic- und OpenAI-Practices sowie native Integrationen für Bedrock, Vertex AI und Azure AI – an demselben Problem: anbieterübergreifende AI-Ausgaben sichtbar, zuordenbar und belastbar zu machen, während sie skalieren – statt als drei separate Rechnungspositionen, die Finance erst nach Eingang der Rechnung entdeckt.
Häufig gestellte Fragen
Was ist AI Cost Management?
AI Cost Management umfasst das Messen, Zuordnen, Prognostizieren und Optimieren der Ausgaben für AI- und LLM-Workloads – Tokens, GPU-Compute, Inferenz und die unterstützende Infrastruktur. Es erweitert die Disziplin, die FinOps für Cloud-Infrastruktur etabliert hat, auf eine Ausgabenkategorie, die sich anders verhält: weniger stabil, stärker gemeinsam genutzt und schneller im Wandel.
Was ist der Unterschied zwischen AI Cost Management und AI FinOps?
In der Praxis werden beide Begriffe synonym verwendet. AI FinOps betont eher das funktionsübergreifende Betriebsmodell – Finance und Engineering arbeiten mit denselben Zahlen –, während AI Cost Management häufiger die zugrunde liegende Praxis und das Tooling beschreibt. Für keinen der beiden Begriffe gibt es bislang eine einheitliche Standarddefinition – was selbst ein Zeichen dafür ist, wie neu die Kategorie ist.
Erweitert Gartner den Magic Quadrant für Cloud Financial Management um AI-spezifische Kriterien?
Vieles deutet darauf hin. Eine Session auf Gartners Konferenz im Dezember 2026 bezeichnet die nächste Ausgabe bereits als Magic Quadrant for Cloud and AI Financial Management (CAIFM) Tools, und die Session-Beschreibung verknüpft diese Umbenennung damit, dass Anbieter danach bewertet werden, wie gut sie die Kosten von AI-Workloads managen und optimieren – nicht nur klassische Cloud-Ausgaben.
Wie unterscheidet sich AI-Kostenoptimierung von Cloud-Kostenoptimierung?
Cloud-Kostenoptimierung bedeutet in der Regel Right-Sizing, Commitment-Management und das Abschalten ungenutzter Ressourcen auf Infrastruktur mit relativ stabilem Owner und Zuschnitt. AI-Kostenoptimierung ergänzt dieses Instrumentarium um Modell-Routing (die Zuordnung der Aufgabenkomplexität zum günstigsten Modell, das sie bewältigen kann), Prompt-Caching und Batch-Verarbeitung – und muss Ausgaben abbilden, deren Ownership mitten in einer Anfrage wechseln kann, was bei klassischer Infrastruktur selten vorkommt.
Wie häufig sind AI-Kostenüberschreitungen?
Häufig genug, um eher die Regel als die Ausnahme zu sein. Eine von DoiT in Auftrag gegebene und im Februar 2026 von Sapio Research unabhängig durchgeführte Umfrage unter 500 Finance-Verantwortlichen ergab, dass 79 % in den vergangenen 12 Monaten AI-bedingte Kostenüberschreitungen erlebt hatten – eine Quote, die bei Organisationen mit der nach eigener Einschätzung ausgereiftesten FinOps-Praxis auf 89 % stieg.
Welche Kennzahlen sollte ein AI-Cost-Management-Programm verfolgen?
Die meisten Programme verfolgen eine Kombination aus Kosten pro Token, Kosten pro Inferenz, Kosten pro Feature und Kosten pro Kunde oder Account – zusammen mit der Aufschlüsselung nach Input-, Output-, gecachten und Reasoning-Tokens, die je nach Anbieter variiert. Engineering-Teams wollen meist Details auf Workload-Ebene; Finance-Teams eher Rollups auf Account- oder Feature-Ebene, verknüpft mit Umsatz- oder Renewal-Daten.