Cloud Intelligence™Cloud Intelligence™

Announcement

Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.

Découvrez le coût réel de chaque modèle derrière votre passerelle Requesty

Connectez votre organisation Requesty à Cloud Intelligence™ et visualisez vos dépenses LLM par modèle, fournisseur d'hébergement, clé API et politique de routage, au prix réel de vos crédits, aux côtés du reste de vos dépenses cloud

Une passerelle LLM est utile précisément parce qu'elle masque certains détails à votre application : quel fournisseur a servi la requête, dans quelle région, quel mécanisme de repli s'est déclenché lorsque le fournisseur principal a atteint sa limite de débit. C'est exactement ce que vous voulez au moment de traiter la requête — et exactement ce que vous ne voulez pas retrouver sur la facture. Requesty débite chaque requête d'un solde de crédits prépayés au tarif catalogue du fournisseur et prélève ses 5 % lorsque vous rechargez : les montants par requête affichés dans son dashboard sont donc inférieurs de 5 % à ce que votre service financier a réellement payé. L'usage est indexé par nom de modèle, si bien que gpt-6-astra servi par OpenAI et gpt-6-astra servi par Azure se retrouvent sous une même étiquette, sauf à ventiler aussi par fournisseur. Déterminer ce qu'une équipe a dépensé le mois dernier sur Claude via Bedrock plutôt que via Vertex suppose un export, un tableur et un relevé de carte bancaire.

Cloud Intelligence™ lit désormais l'usage directement depuis votre organisation Requesty et valorise chaque ligne comme le fait votre facture. Le rapport qui montre ce que votre cluster EKS a coûté hier peut afficher ce qu'il a dépensé en tokens via Requesty, jusqu'à la clé API et la politique de routage qui a choisi le modèle.

Ce que vous obtenez

Les dépenses quotidiennes et la consommation de tokens de chaque modèle utilisé par votre organisation Requesty, importées dans Cloud Analytics en tant que fournisseur à part entière. Le SKU combine fournisseur d'hébergement et modèle : openai/gpt-6-astra et azure/gpt-6-astra restent distincts, et bedrock/claude-haiku-4-5@us-east-1 a sa propre ligne. Les labels vous donnent le fournisseur d'hébergement, la clé API, l'organisation Requesty, ainsi que la politique de routage lorsque c'est un mécanisme de repli, d'équilibrage de charge ou de latence qui a sélectionné le modèle plutôt que votre code. Les tokens en entrée, les tokens en sortie et le nombre de requêtes sont disponibles sous forme de métriques.

Les chiffres signifient exactement ce que votre équipe finance pense qu'ils signifient. Le coût représente les crédits consommés plus la majoration de 5 % de Requesty, et coïncide donc avec les crédits que vous achetez. Le coût catalogue reprend le tarif public du fournisseur, et coïncide donc avec le dashboard d'analytics de Requesty. Sur une organisation de test, nous avons rapproché les deux au centime près avec le débit du solde. Les requêtes en bring-your-own-key sont facturées directement par le fournisseur amont : elles apparaissent donc ici à coût nul afin d'éviter un double comptage avec votre flux OpenAI ou AWS ; leur dépense fournisseur estimée est conservée dans une métrique distincte, genai.cost.byok_external.

Requesty étant intégré comme une source de coûts et d'usage classique, tout ce qui se trouve en aval fonctionne immédiatement : rapports, budgets, détection d'anomalies, prévisions et le dashboard GenAI Intelligence, où Requesty apparaît aux côtés d'OpenRouter, Anthropic, OpenAI, Fireworks AI et de vos autres dépenses d'inférence.

La configuration est volontairement sans surprise. Vous créez une clé API dans la Console Requesty avec la permission Manage réglée sur Read et Completions sur None, vous choisissez un nom pour la connexion, et c'est terminé. Pensez aussi à définir une limite de dépense mensuelle modeste sur cette clé ; Cloud Intelligence™ se contente de lire l'usage et n'envoie jamais de requêtes d'inférence. À la première connexion, nous importons jusqu'à 12 mois d'historique, puis actualisons les données toutes les 6 heures, à mesure que Requesty clôture chaque journée UTC.

Pour commencer

  1. Créez une clé API de gestion dans la Console Requesty avec Manage : Read, Completions : None et une limite de dépense mensuelle.
  2. Connectez votre organisation Requesty dans Cloud Intelligence™, sous Data ingestion and integrations > Integrations, puis lancez Test connection.
  3. Créez un rapport groupé par SKU, ou par les labels Provider, API key et Routing policy, dès réception de l'e-mail confirmant l'import. Les dimensions de reporting Requesty détaillent les correspondances.
  4. Ouvrez le dashboard GenAI Intelligence pour voir Requesty aux côtés de vos autres fournisseurs GenAI.

Le connecteur Requesty est [CONFIRM : disponible dès maintenant pour tous les clients Cloud Intelligence™] et constitue la quatrième passerelle LLM que nous prenons en charge, après OpenRouter, LiteLLM et Bifrost. Si vous exploitez Requesty en production, connectez-le et dites-nous où les chiffres divergent de votre facture. Le trafic bring-your-own-key, en particulier, n'a pour l'instant été validé que sur notre organisation de test, et ce dont nous avons besoin maintenant, c'est de volume réel provenant d'une véritable organisation. Votre account manager ou une demande d'expertise reste la voie la plus rapide.

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis