Cloud Intelligence™Cloud Intelligence™

Announcement

Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

La spesa del gateway LiteLLM entra in Cloud Intelligence™

Basta eseguire un piccolo exporter accanto al proxy LiteLLM: ogni chiamata al modello compare come spesa etichettata, con tutto lo storico recuperato.

Se instrada il traffico LLM attraverso un gateway LiteLLM self-hosted, dispone già di alcuni dei dati di costo più ricchi della Sua azienda: ogni chiamata misurata, prezzata e taggata con la chiave, il team e il cliente finale che l'ha generata. Il problema è dove risiedono questi dati. Restano nel Postgres del proxy, invisibili all'ambiente in cui analizza tutto il resto della spesa. Così le revisioni dei costi AI si riducono a query SQL sul database del gateway, mentre il resto della fattura risiede nei Suoi strumenti FinOps.

Volevamo colmare questo divario. Cloud Intelligence™ ora acquisisce la spesa di LiteLLM, un evento per ogni chiamata al modello, negli stessi report della Sua fattura cloud.

Cosa ottiene

Esegue il litellm-datahub-exporter accanto al Suo proxy: un singolo binario statico o container, configurato con l'URL del proxy e due chiavi. L'exporter interroga le API di spesa di LiteLLM e invia eventi etichettati alla DataHub API. La configurazione è volutamente noiosa.

Ogni chiamata arriva etichettata con provider, modello, chiave virtuale, team e, se li trasmette tramite LiteLLM, il nome della funzionalità e l'identificativo del cliente finale. Questi diventano dimensioni unificate in report, allocazioni e budget: il costo per funzionalità e per cliente diventa così un report che crea in un minuto, e gli stessi eventi alimentano la dashboard AI Intelligence accanto alla Sua spesa per Anthropic, OpenAI, Bedrock, Gemini e Cursor (elenco completo delle integrazioni).

Tre scelte di design che fanno la differenza

Non c'è nessuna pipeline. Nessun collector OpenTelemetry (OTEL) da installare, nessuna regola di filtraggio da mantenere, nessun backend di telemetria tra il Suo gateway e i Suoi report, e DoiT non ha bisogno di alcun accesso alla Sua rete. L'exporter è l'intera integrazione e si trova al di fuori del percorso delle richieste, quindi non potrà mai aggiungere latenza a una chiamata al modello né perderne una.

Lo storico è incluso. Alla prima esecuzione l'exporter recupera i dati dalla retention dei log di spesa, fino a due anni. Gli approcci che intercettano il flusso di telemetria live del gateway vedono solo il traffico dal giorno in cui sono stati attivati; questo, invece, parte dal passato.

Regge alla realtà operativa. Ogni evento ha un id deterministico e le riesportazioni sovrascrivono invece di duplicare. Può riavviare l'exporter, perdere il checkpoint, rielaborare un mese intero dopo un'interruzione: i numeri restano corretti.

LiteLLM calcola i costi dalla propria mappa dei prezzi, non dalle fatture dei provider, quindi ogni evento è etichettato come spesa stimata. Poiché Cloud Intelligence™ dispone anche di integrazioni native con Anthropic e OpenAI che recuperano costi e report di utilizzo lato provider, può riconciliare la vista del gateway con ciò che i provider addebitano effettivamente, in un unico report.

Cosa non esce mai dalla Sua rete

L'exporter è open source con licenza Apache-2.0, abbastanza compatto da poter essere letto dal Suo team di sicurezza in un'unica sessione, e viene eseguito interamente nella Sua infrastruttura. La Sua chiave admin di LiteLLM viene usata solo verso il Suo proxy. Le righe di spesa passano attraverso una rigorosa allowlist di campi, quindi il contenuto di prompt e risposte non può essere esportato nemmeno per errore di configurazione; questa garanzia è applicata a livello di codice, che può verificare direttamente, non in un filtro da ricordarsi di configurare. Le release vengono distribuite come container e binari firmati, con SBOM pubblicati, generati da un workflow CI pubblico che può verificare con cosign.

Per iniziare

  1. Crei un token API di Cloud Intelligence™ con lo scope DataHubAdmin.
  2. Esegua l'exporter accanto al Suo proxy con Docker, Helm o systemd.
  3. Etichetti il traffico con gli identificativi di funzionalità e cliente finale, poi apra Cloud Analytics e raggruppi i dati in base a queste dimensioni.

La Sua spesa compare sotto il provider LiteLLM circa 15 minuti dopo il primo ciclo. L'integrazione richiede un abbonamento DataHub nel Suo piano Cloud Intelligence™; la guida alla connessione di LiteLLM spiega tutto il resto.

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis