Cloud Intelligence™Cloud Intelligence™

Announcement

Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.

Intégrez les dépenses de votre gateway LiteLLM dans Cloud Intelligence™

Déployez un petit exporteur à côté de votre proxy LiteLLM : chaque appel de modèle apparaît comme une dépense labellisée, historique inclus.

Si vous faites transiter votre trafic LLM par une gateway LiteLLM auto-hébergée, vous disposez déjà de données de coûts parmi les plus riches de votre entreprise : chaque appel est mesuré, tarifé et associé à la clé, à l'équipe et au client final qui l'a émis. Le problème, c'est l'endroit où ces données résident. Elles sont stockées dans la base Postgres du proxy, invisibles depuis l'outil où vous analysez toutes vos autres dépenses. Résultat : les revues de coûts IA se transforment en requêtes SQL sur la base de données de la gateway, pendant que le reste de la facture demeure dans vos outils FinOps.

Nous avons voulu combler ce fossé. Cloud Intelligence™ ingère désormais les dépenses LiteLLM, à raison d'un événement par appel de modèle, dans les mêmes rapports que votre facture cloud.

Ce que vous obtenez

Vous exécutez le litellm-datahub-exporter à côté de votre proxy : un binaire statique ou un conteneur, configuré avec l'URL de votre proxy et deux clés. Il interroge les API de dépenses de LiteLLM et pousse des événements labellisés vers l'API DataHub. L'installation est volontairement sans surprise.

Chaque appel arrive labellisé avec le fournisseur, le modèle, la clé virtuelle, l'équipe et, si vous les transmettez via LiteLLM, le nom de votre fonctionnalité et l'identifiant de votre client final. Ces libellés deviennent des dimensions unifiées dans vos rapports, allocations et budgets : le coût par fonctionnalité et par client devient un rapport que vous créez en une minute, et les mêmes événements alimentent le dashboard AI Intelligence aux côtés de vos dépenses Anthropic, OpenAI, Bedrock, Gemini et Cursor (liste complète des intégrations).

Trois choix de conception qui font la différence

Aucun pipeline. Pas de collecteur OpenTelemetry (OTEL) à déployer, pas de règles de filtrage à maintenir, pas de backend de télémétrie entre votre gateway et vos rapports, et aucun accès de DoiT à votre réseau. L'exporteur constitue à lui seul toute l'intégration, et il se situe hors du chemin des requêtes : il ne peut donc jamais ajouter de latence à un appel de modèle, ni en perdre un.

Votre historique vous suit. Au premier lancement, l'exporteur récupère l'historique de vos logs de dépenses, jusqu'à deux ans en arrière. Les approches qui se branchent sur le flux de télémétrie en direct de la gateway ne voient que le trafic à partir du jour de l'instrumentation ; la nôtre commence par le passé.

Il résiste aux conditions réelles d'exploitation. Chaque événement possède un identifiant déterministe, et les réexports écrasent les données au lieu de les dupliquer. Redémarrez l'exporteur, perdez son checkpoint, rejouez un mois entier après un incident : les chiffres restent justes.

LiteLLM calcule les coûts à partir de sa table de prix, pas des factures des fournisseurs : chaque événement est donc marqué comme dépense estimée. Et comme Cloud Intelligence™ dispose aussi d'intégrations natives Anthropic et OpenAI qui récupèrent les coûts et l'utilisation côté fournisseur, vous pouvez réconcilier la vue de la gateway avec ce que les fournisseurs facturent réellement, dans un seul rapport.

Ce qui ne quitte jamais votre réseau

L'exporteur est open source sous licence Apache-2.0, suffisamment compact pour que votre équipe sécurité le lise d'une traite, et il s'exécute entièrement dans votre infrastructure. Votre clé admin LiteLLM n'est utilisée qu'auprès de votre propre proxy. Les lignes de dépenses passent par une liste stricte de champs autorisés : le contenu des prompts et des réponses ne peut pas être exporté, même en cas de mauvaise configuration. Cette garantie est inscrite dans un code que vous pouvez auditer, pas dans un filtre qu'il faudrait penser à configurer. Les versions sont livrées sous forme de conteneurs et de binaires signés, accompagnés de SBOM publiés, générés par un workflow CI public que vous pouvez vérifier avec cosign.

Pour commencer

  1. Créez un token API Cloud Intelligence™ avec le scope DataHubAdmin.
  2. Exécutez l'exporteur à côté de votre proxy avec Docker, Helm ou systemd.
  3. Labellisez votre trafic avec des identifiants de fonctionnalité et de client final, puis ouvrez Cloud Analytics et regroupez vos données selon ces dimensions.

Vos dépenses apparaissent sous le fournisseur LiteLLM environ 15 minutes après le premier cycle. L'intégration nécessite un abonnement DataHub sur votre offre Cloud Intelligence™ ; le guide de connexion LiteLLM couvre le reste.

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis