Announcement
Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.
Descubre cuánto cuesta realmente cada modelo detrás de tu gateway de Requesty
Conecta tu organización de Requesty a Cloud Intelligence™ y ve el gasto en LLM por modelo, proveedor de hosting, API key y política de enrutamiento, valorado según lo que pagas por los créditos, junto al resto de tu gasto en la nube
Un gateway de LLM es útil precisamente porque le oculta cosas a tu aplicación: qué proveedor atendió la solicitud, desde qué región, qué fallback se activó cuando el principal alcanzó un rate limit. Eso es justo lo que quieres en la ruta de la solicitud, pero no lo que quieres en la factura. Requesty descuenta cada solicitud de un saldo de créditos prepagados al precio de lista del proveedor y cobra su 5% cuando recargas, por lo que las cifras por solicitud en su dashboard quedan un 5% por debajo de lo que finanzas pagó en realidad. El uso se registra por nombre de modelo, así que gpt-6-astra servido desde OpenAI y gpt-6-astra servido desde Azure quedan bajo la misma etiqueta, a menos que también separes por proveedor. Averiguar cuánto gastó un equipo el mes pasado en Claude vía Bedrock frente a Vertex implica una exportación, una hoja de cálculo y un estado de cuenta de la tarjeta de crédito.
Cloud Intelligence™ ahora lee el uso directamente desde tu organización de Requesty y valora cada fila tal como lo hace tu factura. El mismo reporte que muestra cuánto costó ayer tu clúster de EKS puede mostrar cuánto se gastó en tokens a través de Requesty, hasta el nivel de la API key y de la política de enrutamiento que eligió el modelo.
Lo que obtienes
Gasto diario y uso de tokens de cada modelo que tocó tu organización de Requesty, importados a Cloud Analytics como un proveedor de pleno derecho. El SKU es proveedor de hosting más modelo, así que openai/gpt-6-astra y azure/gpt-6-astra se mantienen separados y bedrock/claude-haiku-4-5@us-east-1 tiene su propia línea. Las etiquetas te dan el proveedor de hosting, la API key, la organización de Requesty y la política de enrutamiento cuando una política de fallback, balanceo de carga o latencia eligió el modelo en lugar de tu código. Los tokens de entrada, los tokens de salida y el número de solicitudes se incluyen como métricas.
Los números significan lo que finanzas cree que significan. El costo corresponde a los créditos consumidos más el recargo del 5% de Requesty, por lo que coincide con los créditos que compras. El costo de lista es el precio de lista del proveedor, por lo que coincide con el dashboard de analítica de Requesty. En una organización de prueba conciliamos ambos al centavo contra el débito del saldo. Las solicitudes con clave propia (bring-your-own-key) las factura directamente el proveedor upstream, así que aquí aparecen con costo cero para evitar contar dos veces tu feed de OpenAI o AWS; su gasto estimado en el proveedor se conserva como una métrica aparte, genai.cost.byok_external.
Como Requesty entra como una fuente estándar de costos y uso, todo lo que viene después simplemente funciona: reportes, presupuestos, detección de anomalías, pronósticos y el dashboard de GenAI Intelligence, donde Requesty aparece junto a OpenRouter, Anthropic, OpenAI, Fireworks AI y el resto de tu gasto en inferencia.
La configuración es deliberadamente aburrida. Creas una API key en la Requesty Console con el permiso Manage en Read y Completions en None, eliges un nombre para la conexión y listo. Ponle también un límite de gasto mensual bajo a esa API key; Cloud Intelligence™ solo lee el uso y nunca envía solicitudes de inferencia. En la primera conexión importamos hasta 12 meses de historial y luego actualizamos cada 6 horas, a medida que Requesty cierra cada día UTC.
Primeros pasos
- Crea una API key de administración en la Requesty Console con Manage: Read, Completions: None y un límite de gasto mensual.
- Conecta tu organización de Requesty en Cloud Intelligence™, en Data ingestion and integrations > Integrations, y ejecuta Test connection.
- Crea un reporte agrupado por SKU, o por las etiquetas Provider, API key y Routing policy, cuando llegue el correo de importación. Las dimensiones de reporte de Requesty detallan qué corresponde a qué.
- Abre el dashboard de GenAI Intelligence para ver Requesty junto a tus otros proveedores de GenAI.
El conector de Requesty está [CONFIRM: disponible desde ya para todos los clientes de Cloud Intelligence™] y es el cuarto gateway de LLM que soportamos, después de OpenRouter, LiteLLM y Bifrost. Si usas Requesty en producción, conéctalo y cuéntanos en qué puntos los números no coinciden con tu factura. El tráfico bring-your-own-key, en particular, solo ha pasado por nuestra organización de prueba, y lo que necesitamos ahora es volumen real de una organización real. Tu gerente de cuenta o una consulta a expertos es la vía más rápida.
Related documentation
- help.doit.com/docs/connect-third-party/connect-requesty#create-management-api-key
- help.doit.com/docs/connect-third-party/connect-requesty#connect-your-requesty-organization
- help.doit.com/docs/cloud-analytics/reports/report-dimensions-groupings-and-filters
- help.doit.com/docs/connect-third-party/connect-requesty#reporting-dimensions
- help.doit.com/docs/dashboards/genai/genai-intelligence
