Cloud Intelligence™Cloud Intelligence™

Cloud Intelligence™

Costo por tarea, no por token: la economía unitaria de los workloads de LLM de frontera

Un análisis del costo por tarea de los modelos frontera de Anthropic y OpenAI, agosto de 2026

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

Aug 11, 202614 min read
Vadim Solovey

About Vadim Solovey

Founded DoiT in 2011 and have been here ever since — in every flavor of CTO, co-CEO, and now CEO. I started my career in 1999 building data centers before anyone called it "the cloud," and I've spent the two decades since trying to deliver on what the cloud was actually supposed to be. I still write code most weeks.

My personal page

Resumen

El costo por token es la unidad equivocada para workloads agénticos y de producción. La unidad correcta es el costo esperado por tarea completada, más el costo de corregir los resultados incorrectos que se escapan de las verificaciones automatizadas:

E[costo por tarea resuelta]=Cattemptpsuccess\mathbb{E}[\text{costo por tarea resuelta}] = \frac{C_{\text{attempt}}}{p_{\text{success}}}

Si se mira solo el costo bruto en tokens por tarea a mediados de 2026, el modelo frontera más reciente de OpenAI suele ser la opción más barata. Artificial Analysis midió GPT-5.6 Sol en $1.04 por tarea del Intelligence Index, frente a $2.03 de Claude Opus 5 y $2.75 de Claude Fable 5. OpenAI cerró la brecha de eficiencia en tokens.

Anthropic gana en cuanto la confiabilidad entra en el denominador. En tau-bench, Claude Opus 4.8 mantuvo una parte mucho mayor de su puntaje de un solo intento a lo largo de ejecuciones repetidas y violó las políticas menos de la mitad de las veces que GPT-5.5. En bucles desatendidos de alto riesgo, esa consistencia reduce los reintentos y la corrección humana, que es donde está la mayor parte del dinero real.

Hallazgos clave

Los precios de lista de los modelos insignia convergieron. Claude Opus 5 cuesta $5 de entrada / $25 de salida por millón de tokens. GPT-5.6 Sol cuesta $5 / $30. Anthropic ahora es más barato en el precio de lista de salida, no más caro. El viejo argumento de que "Claude cuesta más por token" quedó en gran medida obsoleto en la frontera.

Los conteos de tokens no son comparables entre proveedores. El tokenizador de Anthropic desde Opus 4.7 en adelante produce aproximadamente un 30 por ciento más de tokens para el mismo texto, y Opus 4.8 y Opus 5 reportan cerca de 1.88 tokens por palabra en inglés frente a alrededor de 1.17 con la codificación o200k de GPT-5. Un mismo precio por millón rinde menos palabras de contexto en Claude. Esto distorsiona las comparaciones ingenuas por token en contra de Anthropic.

Los tokens de razonamiento se facturan como tokens de salida en ambas plataformas, y OpenAI los oculta mientras que Anthropic puede devolverlos. Una respuesta visible de 500 tokens puede llevar miles de tokens de razonamiento facturados.

El denominador de la tasa de éxito es el que manda. Un modelo que es un 10 por ciento más caro por intento pero acierta con mucha más consistencia puede resultar mucho más barato por tarea correcta y conforme a las políticas, una vez que se cuentan los reintentos y la corrección humana.

El prompt caching cambia las cuentas de las sesiones largas en ambos lados. Las lecturas de caché cuestan el 10 por ciento de la entrada tanto en los modelos actuales de Anthropic como en los de OpenAI.

Detalles

El problema: el precio por token mide lo que no es

Los equipos eligen modelos según capacidad, disponibilidad y afinidad con el proveedor. Pero al comparar costos, miran una lista de precios: $5 contra $10 por millón de tokens, y ahí se detienen. Esa comparación es casi inútil para cualquier cosa agéntica.

Una tarea agéntica no es una llamada a la API. Es un bucle.

media

Planificar, llamar a una herramienta, leer el resultado, decidir, editar, verificar, repetir. El análisis de Vantage sobre sesiones de programación agénticas modela una sesión representativa de 50 turnos con aproximadamente 1 millón de tokens de entrada y 40,000 de salida, una relación entrada-salida cercana a 25 a 1, con la entrada representando cerca del 85 por ciento del costo total, porque el modelo relee un contexto que se acumula en cada turno. El análisis de Gartner de marzo de 2026 encontró que los flujos de trabajo agénticos consumen entre 5 y 30 veces más tokens por tarea que una consulta simple de chatbot, y su analista director sénior Will Sommer planteó el riesgo sin rodeos: los chief product officers "no deberían confundir la deflación de los tokens commodity con la democratización del razonamiento de frontera". Bai et al. (arXiv:2604.22750), un preprint que analiza trayectorias de ocho LLM de frontera en SWE-bench Verified, con coautores como Erik Brynjolfsson de Stanford y Alex Pentland del MIT, encontró que las tareas de programación agéntica consumen hasta 1,000 veces más tokens que el razonamiento y el chat de código, con una variación de hasta 30x entre ejecuciones y con los tokens de entrada dominando la factura.

La mayoría de los ingenieros nunca ha visto lo que realmente cuesta la trayectoria de un agente. El equipo de Bai et al. publicó sus datos crudos en longjubai.github.io/agent_token_consumption, incluido un juego de adivinanzas: lees una tarea real de programación, predices la factura de tokens y luego ves lo que ocho modelos de frontera gastaron en realidad. Juega tres rondas antes de confiar en cualquier estimación de costos, incluida la tuya. Los propios modelos subestiman su consumo, y tú también lo harás. Esa brecha entre el gasto previsto y el real es todo el argumento a favor de medir el costo por tarea en lugar de pronosticarlo.

De ahí se desprenden dos hechos. Primero, la cantidad de tokens por tarea varía muchísimo según el modelo, así que el mismo precio de lista produce facturas muy distintas. Segundo, una fracción de las tareas falla, y una trayectoria fallida cuesta el precio completo de todos modos. La unidad que sobrevive a ambos hechos es el costo por tarea completada.

Una definición formal

Define el costo de un solo intento como la suma, a lo largo de los pasos de la trayectoria, de los tokens facturados multiplicados por sus precios:

Cattempt=s=1S(inspin+cachespcache+outspout)C_{\text{attempt}} = \sum_{s=1}^{S} \left( \text{in}_s \cdot p_{\text{in}} + \text{cache}_s \cdot p_{\text{cache}} + \text{out}_s \cdot p_{\text{out}} \right)

Si cada intento tiene éxito de forma independiente con probabilidad pp y reintentas hasta lograrlo, el número esperado de intentos es 1/p1/p, por lo que:

E[costo por tarea resuelta]=Cattemptpsuccess\mathbb{E}[\text{costo por tarea resuelta}] = \frac{C_{\text{attempt}}}{p_{\text{success}}}

Si limitas los reintentos a NN intentos, la probabilidad de éxito eventual es 1(1p)N1 - (1-p)^N y el costo esperado del modelo por tarea resuelta sube en consecuencia. Ese es el costo del modelo. No es el costo total.

El costo total incluye los resultados incorrectos que pasan las verificaciones automatizadas y llegan a un humano o a producción:

E[costo total por tarea correcta]=Cattemptpsuccess+LKcleanup\mathbb{E}[\text{costo total por tarea correcta}] = \frac{C_{\text{attempt}}}{p_{\text{success}}} + L \cdot K_{\text{cleanup}}

donde LL es la tasa de fuga, la probabilidad de que un resultado incorrecto o no conforme escape a la detección, y KcleanupK_{\text{cleanup}} es el costo de corregirlo. Este término suele ser invisible en la factura de la API y con frecuencia es mayor que la factura misma.

Precios actuales (agosto de 2026)

Anthropic, API estándar, por millón de tokens:

Modelo Entrada Salida Lectura de caché Batch (entrada/salida)
Claude Fable 5 $10 $50 $1.00 $5 / $25
Claude Opus 5 (insignia por defecto) $5 $25 $0.50 $2.50 / $12.50
Claude Opus 4.8 $5 $25 $0.50 $2.50 / $12.50
Claude Sonnet 5 $2 (intro) / $3 $10 (intro) / $15 $0.30 $1.50 / $7.50
Claude Haiku 4.5 $1 $5 $0.10 $0.50 / $2.50

Las escrituras de caché de Anthropic cuestan 1.25x la entrada para el TTL de 5 minutos y 2x la entrada para el de 1 hora. El precio introductorio de Sonnet 5 de $2 / $10 rige hasta el 31 de agosto de 2026.

OpenAI, API estándar, por millón de tokens:

Modelo Entrada Salida Lectura de caché Batch (entrada/salida)
GPT-5.6 Sol (insignia) $5 $30 $0.50 $2.50 / $15
GPT-5.6 Terra $2 $12 $0.20 $1 / $6
GPT-5.6 Luna $0.20 $1.20 $0.02 $0.10 / $0.60
GPT-5.5 $5 $30 $0.50 $2.50 / $15
GPT-5.4 $2.50 $15 $0.25 $1.25 / $7.50

La Batch API de OpenAI descuenta el 50 por ciento tanto en entrada como en salida con una ventana de 24 horas. Flex ofrece el mismo 50 por ciento con latencia variable. Priority cuesta alrededor de 2.5x a cambio de menor latencia. GPT-5.6 introdujo el precio de escritura de caché a 1.25x la entrada con un mínimo de 30 minutos, igualando el modelo de Anthropic. Ojo con la penalización por contexto largo: en GPT-5.5 y GPT-5.6, cualquier solicitud por encima de unos 272,000 tokens de entrada se factura a 2x la entrada y 1.5x la salida para toda la sesión. Anthropic incluye el contexto completo de 1M a precio fijo en Opus 5, Opus 4.8 y Sonnet 5.

El costo por tarea, medido

Artificial Analysis publica un costo absoluto en dólares por tarea en su Intelligence Index. Con el esfuerzo de razonamiento al máximo, a agosto de 2026: GPT-5.6 Sol cuesta $1.04, Claude Opus 4.8 cuesta $1.80, Claude Opus 5 cuesta $2.03, Claude Sonnet 5 cuesta $2.29 a precios estándar ($1.53 con el precio introductorio que vence el 31 de agosto de 2026) y Claude Fable 5 cuesta $2.75.

En esta suite, el modelo frontera de OpenAI ofrece una inteligencia casi al máximo nivel a aproximadamente un tercio del costo del modelo más capaz de Anthropic. Ese es el titular honesto, y va en contra de la tesis ingenua.

El ranking también es inestable exactamente de la manera que este artículo predice. Cuando Artificial Analysis publicó su análisis del Coding Agent Index en mayo de 2026, Claude Opus 4.7 (max) en Claude Code costaba $4.10 por tarea frente a $4.82 de GPT-5.5 (xhigh) en Codex, una victoria para Claude. El índice en vivo ahora muestra el mismo par en aproximadamente $5.63 y $5.05 al 10 de agosto, con el orden invertido, porque el costo por tarea se recalcula a partir de los precios de tokens actuales y de ejecuciones renovadas. Mismos modelos, mismo benchmark, conclusión opuesta dentro del mismo trimestre. En la generación actual, GPT-5.6 Sol en Codex lidera el índice y resulta alrededor de un 10 por ciento más barato por tarea que Opus 4.8 en Claude Code. El ranking es específico del workload, de la generación y de la fecha, y ese es exactamente el punto.

Ejemplo práctico 1: una tarea de programación donde gana OpenAI

Toma una corrección de bug al estilo SWE-bench. Modela la sesión con caché en el prompt del sistema y las herramientas.

Claude Opus 4.8 a $5 / $25, lectura de caché $0.50. Entrada efectiva de 1,000,000 de tokens, 80 por ciento de lecturas de caché, salida de 40,000 tokens.

  • Entrada: 200k nuevos a $5/M = $1.00, más 800k lecturas de caché a $0.50/M = $0.40.
  • Salida: 40k a $25/M = $1.00.
  • Escritura de caché una sola vez, 50k a $6.25/M = $0.31.
  • Cattempt$2.71C_{\text{attempt}} \approx \$2.71.

GPT-5.6 Sol a $5 / $30, lectura de caché $0.50. Sol es más económico en salida, así que modela 700,000 tokens efectivos de entrada y 15,000 de salida.

  • Entrada: 140k nuevos a $5/M = $0.70, más 560k lecturas de caché a $0.50/M = $0.28.
  • Salida: 15k a $30/M = $0.45.
  • Escritura de caché una sola vez, alrededor de $0.07.
  • Cattempt$1.50C_{\text{attempt}} \approx \$1.50.

Ahora divide por el éxito medido de forma independiente en SWE-bench Verified con el harness de Vals AI: GPT-5.6 Sol 96.2 por ciento, Claude Opus 4.8 88.6 por ciento. Usamos Opus 4.8 aquí porque tiene una cifra medida de forma independiente por Vals AI; las cifras publicadas de Opus 5 mezclan harnesses.

Sol: $1.500.962$1.56 por issue resuelto\text{Sol: } \frac{\$1.50}{0.962} \approx \$1.56 \text{ por issue resuelto} Opus 4.8: $2.710.886$3.06 por issue resuelto\text{Opus 4.8: } \frac{\$2.71}{0.886} \approx \$3.06 \text{ por issue resuelto}

OpenAI gana esta ronda tanto en costo por intento como en tasa de éxito. Para programación autónoma pura en el SWE-bench Verified público a mediados de 2026, el modelo frontera de OpenAI, eficiente en tokens, es la opción más barata por issue resuelto. Cualquier análisis honesto de costo por tarea tiene que reconocerlo.

Ejemplo práctico 2: una tarea de uso de herramientas donde gana Anthropic

Ahora toma un agente de soporte desatendido de una aerolínea que reembolsa y reprograma vuelos. Las acciones equivocadas salen caras porque tocan dinero real y políticas.

Según la prueba de tau-bench de Contra Collective, dominio de aerolíneas: Claude Opus 4.8 pass@1 = 0.64 con 4 violaciones de política por cada 100 tareas. GPT-5.5 pass@1 = 0.58 con 9 violaciones de política por cada 100 tareas. Son diálogos más cortos, así que asume costos por intento de unos $0.30 para Opus y $0.22 para GPT-5.5, más eficiente en tokens. Asume que cada violación de política que se escapa cuesta $25 corregirla, en línea con los benchmarks de resolución de mesas de servicio de 2026.

Esta prueba es anterior a GPT-5.6 Sol, así que el lado de OpenAI está una generación atrás; no se ha publicado ninguna ejecución comparable de Sol en tau-bench airline, y esta comparación debería repetirse cuando exista una.

Por cada 100 tareas, reintentando hasta el éxito más la corrección:

Opus 4.8: 100$0.300.64+4$25=$46.9+$100=$146.9    $1.47 por tarea correcta\text{Opus 4.8: } 100 \cdot \frac{\$0.30}{0.64} + 4 \cdot \$25 = \$46.9 + \$100 = \$146.9 \;\Rightarrow\; \$1.47 \text{ por tarea correcta} GPT-5.5: 100$0.220.58+9$25=$37.9+$225=$262.9    $2.63 por tarea correcta\text{GPT-5.5: } 100 \cdot \frac{\$0.22}{0.58} + 9 \cdot \$25 = \$37.9 + \$225 = \$262.9 \;\Rightarrow\; \$2.63 \text{ por tarea correcta}

media

El precio por token favorecía a OpenAI. El costo por intento favorecía a OpenAI. El costo por tarea correcta, ajustado por éxito y confiabilidad, favoreció a Anthropic por casi 2x, impulsado por completo por el término de corrección. La palanca es el costo de un resultado incorrecto. Cuando ese costo es alto, la consistencia de Claude se paga sola. tau-bench pone esa consistencia en números concretos: Opus 4.8 mantuvo el 56 por ciento de las tareas a lo largo de 8 ejecuciones consecutivas en retail frente al 41 por ciento de GPT-5.5, y el 34 por ciento frente al 22 por ciento en aerolíneas. La consistencia es lo que compras para la operación desatendida.

Distorsiones del tokenizador y de la verbosidad

Dos efectos tiran en direcciones opuestas. Primero, el tokenizador de Anthropic infla los conteos de tokens, así que precios por token iguales subestiman el costo efectivo por palabra de Claude. Segundo, la verbosidad de la salida varía según el modelo y el workload, y aquí la historia se invirtió en 2026. Evaluadores independientes encontraron que GPT-5.5 usó alrededor de un 72 por ciento menos tokens de salida que Claude Opus 4.7 en tareas de programación equivalentes, y Artificial Analysis midió que GPT-5.6 Sol usa menos tokens que Opus 4.8 y aun así obtiene un puntaje más alto en inteligencia. El viejo supuesto de que Claude es el modelo conciso ya no se sostiene en la frontera.

La verbosidad no es lo mismo que la capacidad. El paper de Terminal-Bench 2.0 (arXiv:2601.11868, ICLR 2026) no encontró una relación estadísticamente significativa entre los tokens de salida y el éxito (r = −0.170, p = 0.515), y observó que Claude Sonnet 4.5 y Claude Opus 4.1 lograron tasas de éxito de primer nivel (43 y 38 por ciento) con un uso de tokens relativamente moderado. No hay evidencia de que gastar más tokens se traduzca en más aciertos. Pero más tokens siempre significan una factura más grande, así que mide los tokens de salida por tarea y por modelo en lugar de asumir.

Facturación de los tokens de razonamiento

Ambos proveedores facturan los tokens de pensamiento ocultos o semiocultos al precio de salida. Los tokens de razonamiento de OpenAI son invisibles en la respuesta. Anthropic puede devolver un pensamiento resumido. Opus 5 ahora ejecuta pensamiento adaptativo por defecto, y cada token de pensamiento se factura a $25 por millón, razón por la cual las pruebas con esfuerzo igualado reportan que Opus 5 emite aproximadamente el doble de tokens de salida que Opus 4.8 en la misma tarea. La consecuencia práctica: el nivel de esfuerzo, no la elección del modelo, suele ser lo que más mueve la factura. Instrumenta los tokens de razonamiento por separado de la salida visible.

Caché

El prompt caching es la palanca más poderosa en sesiones agénticas largas. Ambas plataformas cobran las lecturas de caché al 10 por ciento de la entrada. Anthropic usa breakpoints explícitos de cache_control y cobra 1.25x por una escritura de 5 minutos o 2x por una de 1 hora. OpenAI cachea automáticamente por encima de unos 1,024 tokens de prefijo estable. En un bucle de agente, el prompt del sistema, los esquemas de herramientas y un prefijo de conversación creciente se repiten en cada turno, justo el patrón para el que se diseñó el caché. La acumulación de tokens en un bucle es cuadrática. Las lecturas de caché la aplanan hasta volverla casi lineal.

ProjectDiscovery elevó su tasa de aciertos de caché del 7 al 84 por ciento mientras servía 9,800 millones de tokens desde el caché, recortando el gasto real en LLM en un 59 por ciento, con ejecuciones tras la optimización que alcanzaron el 66 por ciento y los últimos 10 días en el 70 por ciento. Un bucle que se dispara al menos cada 5 minutos mantiene su caché de Anthropic caliente indefinidamente, pagando la prima de escritura una sola vez. Pon primero el contenido estable. Nada de lo que va después de un elemento variable se cachea.

Costos ocultos

La factura de la API es el costo visible. El costo oculto es el tiempo humano dedicado a los resultados incorrectos. Un estudio de 2025 citado por LogRocket encontró que los ingenieros sénior dedican en promedio 4.3 minutos a revisar una sugerencia generada por IA frente a 1.2 minutos para código escrito por humanos, y el análisis de Faros AI sobre más de 10,000 desarrolladores encontró un aumento del 98 por ciento en el volumen de pull requests junto con un aumento del 91 por ciento en el tiempo de revisión.

Faros también encontró, en 211 tareas reales de ingeniería, que un modelo más barato con el contexto correcto del repositorio y un bucle de verificación puede vencer a un modelo más fuerte que trabaja a ciegas, lo que significa que la ingeniería de contexto y de harness mueve la propia frontera calidad-costo, a veces más que la elección del modelo. Estos costos recaen sobre las personas más caras y con menos disponibilidad del equipo.

Cómo instrumentar el costo por tarea

Registra los tokens por trayectoria, no por llamada. Etiqueta cada solicitud con un ID de tarea. Suma los tokens de entrada, lectura de caché, escritura de caché, razonamiento y salida visible a lo largo de todo el bucle.

Registra el resultado. Marca cada tarea como resuelta o fallida mediante una verificación automatizada, y registra los reintentos.

Calcula el costo ajustado por tasa de éxito: el total de dólares de la trayectoria dividido por las tareas resueltas. Esa es tu unidad real.

Da seguimiento a una tasa de fuga. Muestrea tareas completadas que pasaron las verificaciones automatizadas y haz que un humano califique su corrección o su cumplimiento de políticas. Multiplica la tasa de fuga por tu costo de corrección con todo incluido.

Reporta el costo por unidad. Por ticket resuelto, por PR fusionado o por acción correcta, por modelo y por nivel de esfuerzo. Hazlo visible para el equipo que lo genera.

Separa desde el diseño el trabajo interactivo del que puede ir por lotes. Dirige la mitad procesable por lotes a Batch o Flex y obtén el 50 por ciento de descuento.

Cloud bill shouldn't be a mystery

One platform for AI and Cloud optimization.

Recomendaciones

Mide por defecto el costo por tarea resuelta, ajustado por reintentos y corrección. Deja de comparar listas de precios. Implementa la instrumentación de seis pasos de arriba antes de elegir un modelo.

Enruta según el workload, no te cases con un solo proveedor. Para trabajo de alto volumen, bajo riesgo y pesado en tokens, como clasificación, extracción y generación masiva, prefiere el nivel más barato que supere tu estándar de calidad, lo que hoy suele significar GPT-5.6 Luna, GPT-5.4 o Claude Haiku 4.5 en Batch. Para programación autónoma en repositorios bien probados, GPT-5.6 Sol es actualmente la opción más fuerte en costo por issue resuelto en el SWE-bench Verified público. Para uso desatendido de herramientas de alto riesgo, donde una acción equivocada sale cara, prefiere Claude Opus 5 u Opus 4.8 por su consistencia y su menor tasa de violaciones de política.

Activa el caché antes de optimizar cualquier otra cosa. Pon primero los prompts del sistema y los esquemas de herramientas, mantenlos estables y confirma los aciertos de caché en el objeto de uso. Espera ahorros de entrada del 50 al 70 por ciento en bucles de agentes.

Ajusta los niveles de esfuerzo por clase de tarea. En modelos de pensamiento adaptativo, el ajuste de esfuerzo mueve la factura más que la elección del modelo. Limita los tokens de salida a lo que la interfaz de destino realmente consume.

Umbrales que deberían cambiar tu decisión: si tu verificación automatizada atrapa prácticamente todos los resultados incorrectos y la corrección es barata, el término de corrección desaparece y el modelo de OpenAI, eficiente en tokens, suele ganar. Si la corrección cuesta más de aproximadamente 5 a 10 veces un solo intento, la ventaja de confiabilidad de Anthropic domina y te conviene pagar el precio más alto por intento. Vuelve a hacer los cálculos cada vez que salga un modelo nuevo, porque la frontera cambia de precios más o menos cada mes.

Para conocer el modelo formal detrás de estos números, incluida la derivación del costo de corrección de punto de equilibrio y un protocolo de medición replicable, consulta el whitepaper complementario.

Salvedades

La frontera se mueve rápido. Los precios y los nombres de modelos de este artículo están vigentes a agosto de 2026 y varios provienen de rastreadores secundarios y no de páginas de precios oficiales. Verifícalos contra las páginas de precios en vivo de Anthropic y OpenAI antes de comprometer un presupuesto.

Los puntajes de benchmarks de ambos lados están parcialmente inflados por la memorización y el reward hacking. METR reportó que GPT-5.6 Sol mostró una tasa de reward hacking más alta que la de cualquier modelo público que hubiera evaluado en su harness ReAct. Las cifras de SWE-bench reportadas por los proveedores son autorreportadas y usan harnesses distintos. Trata con cautela unos pocos puntos de diferencia en un benchmark y ejecuta tu propia evaluación con datos reservados.

Los dos ejemplos prácticos usan conteos de tokens y costos de corrección plausibles pero construidos. Ilustran el mecanismo. Tus números serán distintos. El punto es el método, no los dólares específicos.

Las cifras de costo por tarea de Artificial Analysis corresponden a la suite del Intelligence Index, no a programación en específico, y las cifras de tau-bench provienen de una sola prueba de una consultora que no está revisada por pares. Las comparaciones de costo contra éxito entre harnesses son direccionales, no exactas.

Este análisis excluye el fine-tuning, la capacidad dedicada y los precios negociados a nivel empresarial, cualquiera de los cuales puede cambiar el ranking.