Cloud Intelligence™Cloud Intelligence™

Announcement

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

Veja quanto custa de verdade cada modelo por trás do seu gateway Requesty

Conecte sua organização Requesty ao Cloud Intelligence™ e veja o gasto com LLMs por modelo, provedor de hospedagem, chave de API e política de roteamento, precificado pelo que você paga em créditos, lado a lado com o restante do seu gasto em nuvem

Um gateway de LLM é útil justamente porque esconde coisas da sua aplicação: qual provedor atendeu a requisição, em qual região, qual fallback foi acionado quando o principal esbarrou em um rate limit. É isso que você quer no caminho da requisição — e não o que você quer na fatura. O Requesty debita cada requisição de um saldo de créditos pré-pago pelo preço de tabela do provedor e cobra os seus 5% quando você faz a recarga, então os valores por requisição no dashboard dele ficam 5% abaixo do que o financeiro pagou de fato. O uso é indexado pelo nome do modelo, então gpt-6-astra servido pela OpenAI e gpt-6-astra servido pelo Azure acabam sob o mesmo rótulo, a menos que você também separe por provedor. Descobrir quanto um time gastou com Claude via Bedrock versus Vertex no mês passado significa uma exportação, uma planilha e um extrato do cartão de crédito.

O Cloud Intelligence™ agora lê o uso diretamente da sua organização Requesty e precifica cada linha do mesmo jeito que a sua fatura. O relatório que mostra quanto seu cluster EKS custou ontem pode mostrar quanto ele gastou em tokens pelo Requesty, até o nível da chave de API e da política de roteamento que escolheu o modelo.

O que você ganha

Gasto diário e uso de tokens de cada modelo utilizado pela sua organização Requesty, importados para o Cloud Analytics como um provedor de primeira classe. O SKU é provedor de hospedagem mais modelo, então openai/gpt-6-astra e azure/gpt-6-astra ficam separados e bedrock/claude-haiku-4-5@us-east-1 tem sua própria linha. Os rótulos trazem o provedor de hospedagem, a chave de API, a organização Requesty e a política de roteamento quando uma política de fallback, balanceamento de carga ou latência escolheu o modelo em vez do seu código. Tokens de entrada, tokens de saída e contagem de requisições vêm junto como métricas.

Os números significam exatamente o que o financeiro acha que significam. O custo é o valor debitado em créditos mais os 5% de acréscimo do Requesty, então bate com os créditos que você compra. O custo de tabela é o preço de tabela do provedor, então bate com o dashboard de analytics do Requesty. Em uma organização de teste, reconciliamos ambos, centavo por centavo, com o débito no saldo. Requisições com chave própria (bring-your-own-key) são cobradas diretamente pelo provedor upstream, então aparecem aqui com custo zero para evitar contagem dupla com seu feed da OpenAI ou da AWS; o gasto estimado com o provedor fica registrado como uma métrica separada, genai.cost.byok_external.

Como o Requesty entra como uma fonte comum de custo e uso, tudo que vem depois simplesmente funciona: relatórios, orçamentos, detecção de anomalias, previsões e o dashboard GenAI Intelligence, onde o Requesty aparece ao lado de OpenRouter, Anthropic, OpenAI, Fireworks AI e do restante do seu gasto com inferência.

A configuração é propositalmente sem graça. Você cria uma chave de API no Console do Requesty com a permissão Manage definida como Read e Completions definida como None, escolhe um nome para a conexão e pronto. Aproveite e defina um limite de gasto mensal baixo nessa chave; o Cloud Intelligence™ apenas lê o uso e nunca envia requisições de inferência. Na primeira conexão, fazemos o backfill de até 12 meses de histórico e, depois disso, atualizamos a cada 6 horas, conforme o Requesty fecha cada dia em UTC.

Como começar

  1. Crie uma chave de API de gerenciamento no Console do Requesty com Manage: Read, Completions: None e um limite de gasto mensal.
  2. Conecte sua organização Requesty no Cloud Intelligence™ em Data ingestion and integrations > Integrations e execute Test connection.
  3. Monte um relatório agrupado por SKU, ou pelos rótulos de Provider, API key e Routing policy, assim que o e-mail de importação chegar. As dimensões de relatório do Requesty mostram o que mapeia para onde.
  4. Abra o dashboard GenAI Intelligence para ver o Requesty ao lado dos seus outros provedores de GenAI.

O conector do Requesty está [CONFIRM: disponível agora para todos os clientes do Cloud Intelligence™] e é o quarto gateway de LLM que suportamos, depois de OpenRouter, LiteLLM e Bifrost. Se você roda o Requesty em produção, conecte-o e nos conte onde os números divergem da sua fatura. O tráfego com chave própria (bring-your-own-key), em particular, só passou pela nossa organização de teste até agora, e volume real de uma organização real é o que precisamos em seguida. Seu gerente de conta ou uma consulta a especialistas é o caminho mais rápido.

PerfectScale™ for Kubernetes

Ready to optimize?

Get your free Kubernetes savings analysis