Cloud Intelligence™Cloud Intelligence™

Announcement

このページはEnglish、Deutsch、Español、Français、Italiano、Portuguêsでもご覧いただけます。

Requestyゲートウェイの裏側で、各モデルの本当のコストを可視化

Requesty組織をCloud Intelligence™に接続すれば、モデル別・ホスティングプロバイダー別・APIキー別・ルーティングポリシー別のLLM支出を、クレジットの実支払額ベースで、他のクラウド支出と並べて確認できます

LLMゲートウェイが便利なのは、アプリケーションから多くを隠してくれるからです。どのプロバイダーがリクエストを処理したのか、どのリージョンだったのか、プライマリがレート制限に達したときにどのフォールバックが発動したのか。リクエストパスではそれが望ましい一方、請求書の上では困りものです。Requestyは各リクエストをプロバイダーの定価でプリペイドクレジット残高から引き落とし、クレジットのチャージ時に5%の手数料を課金します。そのため、ダッシュボードに表示されるリクエスト単位の金額は、経理が実際に支払った額より5%低くなります。使用量はモデル名をキーに記録されるため、OpenAIから提供されたgpt-6-astraとAzureから提供されたgpt-6-astraは、プロバイダーでも分割しない限り同じラベルにまとめられてしまいます。先月あるチームがBedrock経由とVertex経由でClaudeにいくら使ったかを知るには、エクスポートとスプレッドシート、そしてクレジットカードの明細が必要でした。

Cloud Intelligence™が、お客様のRequesty組織から使用量を直接読み取り、すべての行に請求書と同じ価格を適用できるようになりました。昨日のEKSクラスターのコストを表示するレポートで、Requesty経由のトークン支出も、APIキーやモデルを選んだルーティングポリシーのレベルまで確認できます。

提供内容

Requesty組織が利用したすべてのモデルの日次支出とトークン使用量が、正式なプロバイダーとしてCloud Analyticsに取り込まれます。SKUはホスティングプロバイダーとモデルの組み合わせなので、openai/gpt-6-astraとazure/gpt-6-astraは別々に扱われ、bedrock/claude-haiku-4-5@us-east-1も独立した行になります。ラベルには、ホスティングプロバイダー、APIキー、Requesty組織に加え、コードではなくフォールバック、ロードバランシング、レイテンシーの各ポリシーがモデルを選んだ場合には、そのルーティングポリシーが付与されます。入力トークン、出力トークン、リクエスト数もメトリクスとして取り込まれます。

数値は、経理が想定するとおりの意味を持ちます。コストは引き落とされたクレジットにRequestyの5%の上乗せを加えたもので、購入したクレジットと一致します。定価コストはプロバイダーの定価で、Requestyの分析ダッシュボードと一致します。テスト組織では、どちらも残高の引き落としと1セント単位まで照合済みです。Bring-your-own-keyのリクエストは上流のプロバイダーが直接課金するため、OpenAIやAWSのフィードとの二重計上を避けるべく、ここではコストゼロとして扱われます。その推定プロバイダー支出は、別のメトリクスgenai.cost.byok_externalとして保持されます。

Requestyは通常のコスト・使用量ソースとして取り込まれるため、下流の機能はすべてそのまま動作します。レポート、予算、異常検知、予測はもちろん、GenAI Intelligenceダッシュボードでも、RequestyがOpenRouter、Anthropic、OpenAI、Fireworks AIをはじめとする他の推論支出と並んで表示されます。

セットアップは、あえて地味に作ってあります。Requesty ConsoleでManage権限をRead、CompletionsをNoneに設定したAPIキーを1つ作成し、接続の名前を決めれば完了です。そのキーには少額の月次支出上限も設定してください。Cloud Intelligence™は使用量を読み取るだけで、推論リクエストを送信することは一切ありません。初回接続時には最大12か月分の履歴をバックフィルし、その後はRequestyが各UTC日を締めるのに合わせて6時間ごとに更新します。

始め方

  1. Requesty Consoleで、Manage: Read、Completions: None、月次支出上限を設定した管理用APIキーを作成します。
  2. Cloud Intelligence™の「Data ingestion and integrations > Integrations」でRequesty組織を接続し、Test connectionを実行します。
  3. インポート完了のメールが届いたら、SKU別、またはProvider・APIキー・Routing policyの各ラベル別にグルーピングしたレポートを作成します。何がどこにマッピングされるかは、Requestyのレポーティングディメンションにまとまっています。
  4. GenAI Intelligenceダッシュボードを開くと、Requestyが他のGenAIプロバイダーと並んで表示されます。

Requestyコネクタは[CONFIRM: 現在、すべてのCloud Intelligence™のお客様にご利用いただけます]。OpenRouter、LiteLLM、Bifrostに続く、当社が対応する4つ目のLLMゲートウェイです。本番環境でRequestyをお使いなら、ぜひ接続して、数値が請求書と食い違う箇所を教えてください。特にBring-your-own-keyのトラフィックは、これまで当社のテスト組織でしか検証できておらず、次に必要なのは実際の組織からの本物のボリュームです。最短のルートは、アカウントマネージャーへのご連絡、またはエキスパートへの問い合わせです。

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis