Cloud Intelligence™
Tus desarrolladores quieren un LLM self-hosted. Tu CFO quiere los números.
El punto de equilibrio para autoalojar un LLM no es un tamaño de equipo: es un nivel de gasto, y con datos reales de uso empresarial llega antes de lo que sugieren las páginas de precios. Aquí están los números, desde la diferencia de 3.2x en los precios de renta de H100 hasta el mes en que tu factura de API supera a un nodo con GPU
Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.
Este post te dice cuánto cuesta tu stack de IA. Attribute te dice a qué equipos y productos pertenece ese costo.
About Vadim Solovey
Founded DoiT in 2011 and have been here ever since — in every flavor of CTO, co-CEO, and now CEO. I started my career in 1999 building data centers before anyone called it "the cloud," and I've spent the two decades since trying to deliver on what the cloud was actually supposed to be. I still write code most weeks.
My personal pageLos precios de lista parecen imbatibles. Claude Code cuesta entre $100 y $200 al mes en los planes Max, o $100 por usuario con facturación anual en Team Premium; Codex está en el mismo rango. Cincuenta desarrolladores cuestan entre $5,000 y $10,000 al mes, una fracción de cualquier clúster de GPU que pudiera atenderlos, y el argumento del self-hosting terminaría ahí mismo.
Pero esos planes tienen límites de uso estrictos, y el uso intensivo dejó de tener forma humana. Un agente en segundo plano que revisa cada pull request, un barrido nocturno de codemods sobre 400 repositorios, un pipeline de CI que genera y repara tests: todo eso corre con precios por consumo (lista: $3 por millón de tokens de entrada y $15 por millón de salida para Sonnet 5; $5 y $25 para Opus 5), nadie te lo limita, y la factura escala con la ambición, no con el número de personas.
Podemos ponerle un número a ese cambio, porque nos pasó a nosotros. En el equipo de ingeniería de DoiT, con precios por consumo de Claude Code Enterprise, el promedio hoy ronda los $2,200 por desarrollador al mes. No el techo: el promedio. Y no es estático: ha crecido cada mes conforme se extienden los flujos de trabajo agénticos, sin señales de meseta. Tu número será distinto — un equipo de usuarios ligeros en planes con límite realmente cuesta $100 por cabeza, y si ese es tu equipo, la suscripción gana y puedes dejar de leer — pero la dirección de la curva es la misma en todos los casos que hemos visto. Así que la verdadera pregunta no es "¿deberían diez desarrolladores rentar una GPU?", sino a qué nivel de gasto sostenido un nodo rentado le gana a una API por consumo para el trabajo que un modelo open-weight puede manejar de verdad.
Lo que realmente cuesta un nodo
Comparar precios de GPU es genuinamente difícil. Al momento de escribir esto, una H100 se renta bajo demanda a $3.85 la hora en Nebius, $6.88 en AWS (la p5.4xlarge de una sola GPU en us-east-1 — la p5.48xlarge de 8 GPUs cuesta $55.04, exactamente ocho veces más), $10.98 en GCP (a3-highgpu-8g, us-central1) y $12.29 en Azure (ND96isr, East US). Es una diferencia de 3.2x sobre el mismo silicio.
Y en realidad no rentas una GPU: rentas una caja con ocho. Casi todas las instancias de GPU serias vienen como nodos de 8 GPUs, así que la pregunta de dimensionamiento es "cuántos nodos", no "cuántas GPUs". Un nodo, las 24 horas durante un mes:
| $/GPU-hr | Nodo/mes (~730 hrs) | |
|---|---|---|
| Nebius spot | $2.15 | ~$12,600 |
| Nebius bajo demanda | $3.85 | ~$22,500 |
| AWS bajo demanda | $6.88 | ~$40,200 |
| GCP bajo demanda | $10.98 | ~$64,100 |
| Azure bajo demanda | $12.29 | ~$71,800 |
Las mismas GPUs, el mismo mes, $59,000 de diferencia entre los extremos de la tabla. Dos ajustes antes de anclarte en cualquiera de esos extremos. Los commitments reducen la brecha: una reserva de 1 año en AWS deja el nodo en unos $43 la hora (aproximadamente $31,600 al mes), los Capacity Blocks se han cerrado recientemente en torno a $5.20 por GPU-hora, y los commitments de 3 años con los hyperscalers pueden reducir el precio bajo demanda casi a la mitad. Y el extremo barato tiene sus contras: el Spot puede ser reclamado a mitad de una solicitud — y en un mercado con capacidad escasa puede simplemente no estar disponible cuando lo necesitas — mientras que a los proveedores de bajo costo les falta el ecosistema que tu equipo de plataforma ya conoce. Si eso vale $30,000 al mes es una conversación real, pero debería ser una conversación, no una decisión automática.
Dónde está la línea
Ahora las dos curvas pueden cruzarse. Un nodo 8xH100 saturado sirviendo un modelo open-weight de clase 120B con continuous batching produce varios miles de millones de tokens de salida al mes — tokens que facturarían varias decenas de miles de dólares a precios de Sonnet 5, desde un nodo que cuesta entre $12,600 y $40,200. La regla práctica se desprende sola: cuando tu gasto de IA por consumo en trabajo que un modelo open-weight maneja de verdad — de alto volumen, repetitivo, evaluable — se sostiene por encima de aproximadamente el precio mensual de un nodo, el self-hosting sale más barato, y la ventaja crece con el volumen. A $2,200 por desarrollador, esa línea cae en algún punto entre siete y dieciocho desarrolladores.
Antes de que alguien le reenvíe esto a un CFO, dos precisiones honestas que suben la vara. Si necesitas la disponibilidad que una API te da gratis, cotiza dos nodos, no uno: una sola réplica significa que un reinicio deja al asistente fuera de servicio para todos. Y alguien tiene que operarlo — model serving, cuantización, failover, actualizaciones — así que incluye el costo total de un ingeniero dentro de la comparación, no en una nota al pie. Con ambos ajustes, la línea honesta es un gasto sostenido cómodamente por encima del precio de dos nodos y una fracción del tiempo de un ingeniero — lo que, a niveles de uso reales, sigue siendo apenas el workload agéntico de unas cuantas decenas de desarrolladores.
El caso límite que se salta los números por completo: si tu código o tus datos no pueden salir de tu perímetro, el self-hosting nunca fue una decisión de costos, y el punto de quiebre está donde diga tu equipo de compliance.
La prueba de realidad por tamaño de equipo
Los tamaños de equipo siguen sirviendo para aterrizar los números, siempre que dimensiones por concurrencia y no por número de personas: los desarrolladores generan en ráfagas, y en cualquier momento dado quizá entre el 10 y el 20 por ciento de un equipo tiene una solicitud en curso.
Diez desarrolladores son dos o tres sesiones concurrentes — la mitad de la capacidad de un nodo, en el mejor de los casos. La factura del asistente, a nuestro nivel de uso, ronda los ~$22,000 al mes contra $12,600 a $40,200 por un nodo que el equipo no puede mantener ocupado: prácticamente un empate, y con la suscripción estás pagando por un modelo de frontera, así que sigue ganando. No hagas self-hosting a este tamaño salvo que aplique la restricción de perímetro de datos.
Cincuenta desarrolladores son de cinco a diez sesiones concurrentes — un solo nodo 8xH100 atiende a todo el equipo con modelos de hasta clase 120B. La factura del asistente, con uso real, ronda los ~$110,000 al mes contra el mismo nodo: de tres a nueve veces lo que cuesta el hardware.
Cien desarrolladores son dos o tres nodos, $45,000 a $80,000 al mes rentados bajo demanda, contra una factura de asistente de ~$220,000. Aquí también entra en escena ser dueño del hardware. Un servidor 8xH100 cuesta unos $280,000; depreciado en línea recta a tres años son $7,800 al mes, digamos $10,000 a $12,000 con energía, colocation y operación, así que frente a $40,200 bajo demanda en AWS el hardware se paga solo en menos de un año. Sé claro con tu equipo de finanzas: este es un cálculo de recuperación de caja, puro y simple — la línea recta a tres años es el calendario de depreciación, sin costo de capital ni estimación de valor residual. El contraargumento es la utilización: esa recuperación asume que el nodo corre a tope las 24 horas, y un workload que está ocupado 50 horas a la semana usa el 30 por ciento de las horas que compraste — momento en el cual tu costo efectivo on-prem se triplica, la nube te permite no pagar por noches ni fines de semana, y los precios reservados cierran la mayor parte de la brecha restante. Ser dueño gana cuando la utilización es alta y predecible; rentar gana cuando no lo es. La hoja de cálculo suele decir compra; los datos de utilización suelen decir renta. Confía en los datos de utilización.
Cloud bill shouldn't be a mystery
One platform for AI and Cloud optimization.
Qué compras realmente con ese sobreprecio
Con cincuenta desarrolladores, la brecha entre la factura del asistente y el nodo es de aproximadamente $70,000 a $100,000 al mes. Eso no es solo un sobreprecio por la etiqueta del modelo — la API por consumo incluye resiliencia que de otro modo comprarías como un segundo nodo, elasticidad que de otro modo comprarías como capacidad ociosa, riesgo de capacidad que asume otro, herramientas de seguridad y soporte, actualizaciones de modelo sin renovar el hardware, y cero riesgo de quedarte con hardware inservible cuando el modelo del próximo año pida las GPUs del próximo año. Dos puntos más a su favor: el modelo de frontera resuelve más problemas por intento — en costo por pull request integrado parte del múltiplo se cierra, y solo tu propia evaluación dice cuánto — y los precios de lista por token siguen bajando conforme los proveedores de frontera de menor costo los presionan, así que el lado API de esta comparación mejora por sí solo de una manera en que un commitment de GPU firmado no lo hace.
El contrapeso favorece al self-hosting exactamente donde aplica: la predictibilidad. El gasto por desarrollador es el lado volátil de este balance — el nuestro ha crecido cada mes — mientras que un nodo rentado es un número fijo y conocido. Para el trabajo de alto volumen y evaluable que de todos modos pertenece a un modelo open-weight, estás cambiando una factura sin techo por una fija. Aun descontando todo lo que ese sobreprecio incluye, la brecha a partir de cincuenta desarrolladores sigue siendo lo bastante amplia como para financiar al ingeniero que opera el nodo.
Qué hacer en la práctica
La conclusión es un portfolio, no un bando:
- Asientos con límite para los usuarios ligeros — a $100 por cabeza, nada les gana.
- API de frontera por consumo para los problemas que genuinamente necesitan calidad de frontera — paga el sobreprecio donde la evaluación diga que se lo gana.
- Un nodo open-weight self-hosted para el trabajo de alto volumen, repetitivo y evaluable — desde el día en que tu gasto sostenido por consumo en ese trabajo supere el precio del nodo (o dos nodos más un ingeniero, si eres honesto con la disponibilidad y la operación).
- Self-hosting sin importar el costo cuando el código no puede salir de tu perímetro.
Con números reales de uso empresarial, la mayoría de los equipos cruza la línea del self-hosting antes de lo que las páginas de precios — y los proveedores — sugerirían.
Haz tus propios cálculos
Estés en el nivel que estés, cuatro variables dominan el resultado: qué modelo (la cantidad de parámetros fija el piso de GPUs), la cuantización (FP8 reduce a la mitad la memoria de FP16, INT4 la vuelve a reducir a la mitad, cada una con un costo en calidad), la longitud de contexto (el KV cache de contextos largos puede rivalizar en memoria con los propios pesos) y el objetivo de concurrencia (define las réplicas, que multiplican todo lo anterior).
Nos cansamos de rehacer esta hoja de cálculo para cada conversación con clientes, así que la publicamos en la web: la calculadora de hosting de IA dimensiona cualquiera de ~29 modelos open-weight contra los precios actuales de GPU, obtenidos periódicamente de las propias APIs de precios de los proveedores, junto a una estimación de armado on-prem. Cada número de este post sale de ahí, y cada número que ves ahí se remonta a una fórmula o a un supuesto explícito que puedes cuestionar.
Los precios de este post corresponden a un momento específico (agosto de 2026, con las regiones de referencia mencionadas arriba) y van a moverse — las rentas de GPU en una dirección, los precios por token muy probablemente en la otra. Si tu equipo está en algún punto entre "el hilo que murió" y "tres nodos y un contrato de colocation", haz tus propios cálculos antes de que cualquiera de los dos bandos gane por default.