Cloud Intelligence™Cloud Intelligence™

Announcement

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

Traga os gastos do gateway LiteLLM para o Cloud Intelligence™

Execute um pequeno exporter ao lado do seu proxy LiteLLM e cada chamada de modelo aparece como gasto rotulado, com o histórico preenchido retroativamente.

Se você roteia tráfego de LLM por um gateway LiteLLM self-hosted, você já tem alguns dos dados de custo mais ricos da sua empresa: cada chamada medida, precificada e marcada com a chave, o time e o cliente final que a originou. O problema é onde esses dados moram. Eles ficam no Postgres do próprio proxy, invisíveis para o lugar onde você analisa todo o resto dos seus gastos. Resultado: as revisões de custo de IA viram consultas SQL no banco de dados do gateway, enquanto o resto da fatura fica nas suas ferramentas de FinOps.

Queríamos fechar essa lacuna. O Cloud Intelligence™ agora ingere os gastos do LiteLLM, um evento por chamada de modelo, nos mesmos relatórios da sua fatura de nuvem.

O que você ganha

Você executa o litellm-datahub-exporter ao lado do seu proxy: um binário estático ou container, configurado com a URL do proxy e duas chaves. Ele consulta as APIs de gastos do LiteLLM e envia eventos rotulados para a DataHub API. A configuração é entediante de propósito.

Cada chamada chega rotulada com provedor, modelo, chave virtual e time — e, se você os repassar pelo LiteLLM, também com o nome da sua feature e o identificador do cliente final. Tudo isso vira dimensões unificadas em relatórios, alocações e orçamentos, então custo por feature e por cliente é um relatório que você monta em um minuto, e os mesmos eventos alimentam o dashboard de AI Intelligence ao lado dos seus gastos com Anthropic, OpenAI, Bedrock, Gemini e Cursor lista completa de integrações.

Três escolhas de design que fazem diferença

Não existe pipeline. Nenhum collector OpenTelemetry (OTEL) para implantar, nenhuma regra de filtro para manter, nenhum backend de telemetria entre o seu gateway e os seus relatórios — e a DoiT não precisa acessar nada dentro da sua rede. O exporter é a integração inteira e fica fora do caminho das requisições, então nunca adiciona latência a uma chamada de modelo nem descarta nenhuma.

O histórico vai junto. Na primeira execução, o exporter preenche retroativamente a partir da retenção dos seus logs de gastos, até dois anos. Abordagens que capturam o stream de telemetria ao vivo do gateway só enxergam o tráfego a partir do dia em que você as instrumentou; esta começa pelo passado.

Ele aguenta a operação do mundo real. Cada evento tem um id determinístico, e reexportações sobrescrevem em vez de duplicar. Reinicie o exporter, perca o checkpoint dele, reprocesse um mês inteiro depois de uma queda; os números continuam certos.

O LiteLLM calcula o custo a partir do próprio mapa de preços, não das faturas dos provedores, então cada evento é rotulado como gasto estimado. Como o Cloud Intelligence™ também tem integrações nativas com Anthropic e OpenAI que puxam relatórios de custo e uso do lado do provedor, você pode conciliar a visão do gateway com o que os provedores realmente cobram, em um único relatório.

O que nunca sai da sua rede

O exporter é open source sob a licença Apache-2.0, pequeno o suficiente para o seu time de segurança ler de uma só vez, e roda inteiramente na sua infraestrutura. Sua chave de admin do LiteLLM é usada apenas no seu próprio proxy. As linhas de gastos passam por uma allowlist rígida de campos, então o conteúdo de prompts e respostas não pode ser exportado nem mesmo por erro de configuração; essa garantia está aplicada em código que você pode auditar, não em um filtro que você precisa lembrar de configurar. As versões são publicadas como containers e binários assinados, com SBOMs disponíveis, construídos por um workflow público de CI que você pode verificar com cosign.

Comece agora

  1. Crie um token de API do Cloud Intelligence™ com o escopo DataHubAdmin.
  2. Execute o exporter ao lado do seu proxy com Docker, Helm ou systemd.
  3. Rotule seu tráfego com identificadores de feature e de cliente final, depois abra o Cloud Analytics e agrupe por eles.

Seus gastos aparecem no provedor LiteLLM cerca de 15 minutos após o primeiro ciclo. A integração exige uma assinatura do DataHub no seu tier do Cloud Intelligence™; o guia de conexão do LiteLLM cobre o resto.

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis