Cloud Intelligence™
I Suoi sviluppatori vogliono un LLM self-hosted. Il Suo CFO vuole i numeri.
Il break-even del self-hosting di un LLM non è una dimensione del team: è un livello di spesa — e con dati di utilizzo enterprise reali arriva prima di quanto lascino intendere le pagine dei prezzi. Ecco i calcoli, dal divario di 3,2x nei prezzi di noleggio delle H100 fino al mese in cui la bolletta API supera il costo di un nodo GPU
Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.
Questo articolo Le dice quanto costa il Suo stack AI. Attribute Le dice a quali team e prodotti appartiene quel costo.
About Vadim Solovey
Founded DoiT in 2011 and have been here ever since — in every flavor of CTO, co-CEO, and now CEO. I started my career in 1999 building data centers before anyone called it "the cloud," and I've spent the two decades since trying to deliver on what the cloud was actually supposed to be. I still write code most weeks.
My personal pageI prezzi di listino sembrano imbattibili. Claude Code costa da 100 a 200 dollari al mese con i piani Max, oppure 100 dollari a postazione con fatturazione annuale su Team Premium; Codex si colloca nella stessa fascia. Cinquanta sviluppatori costano da 5.000 a 10.000 dollari al mese, una frazione di qualsiasi cluster GPU in grado di servirli, e la discussione sul self-hosting finirebbe lì.
Ma quei piani hanno tetti di utilizzo rigidi, e l'utilizzo serio ha smesso di essere a misura d'uomo. Un agente in background che revisiona ogni pull request, una passata notturna di codemod su 400 repository, una pipeline CI che genera e ripara i test: tutto questo gira con prezzi a consumo (listino: 3 $ per milione di token in input e 15 $ per milione in output per Sonnet 5; 5 $ e 25 $ per Opus 5), nessuno li limita per Lei e la bolletta cresce con l'ambizione, non con l'organico.
Possiamo quantificare quel cambiamento, perché lo abbiamo vissuto in prima persona. Nel team di engineering di DoiT, con il piano Claude Code Enterprise a consumo, la media è ora di circa 2.200 dollari per sviluppatore al mese. Non il tetto — la media — e non è statica: è cresciuta ogni mese man mano che i workflow agentici si diffondevano, senza alcun plateau in vista. Il Suo numero sarà diverso — un team di utenti leggeri su piani con tetto costa davvero 100 dollari a testa, e se il Suo team è così, vince l'abbonamento e può smettere di leggere qui — ma la direzione della curva è la stessa ovunque guardiamo. Quindi la vera domanda non è "dieci sviluppatori dovrebbero noleggiare una GPU?", ma a quale livello di spesa sostenuta un nodo a noleggio batte un'API a consumo per il lavoro che un modello open-weight è davvero in grado di gestire.
Quanto costa davvero un nodo
Confrontare i prezzi delle GPU è oggettivamente difficile. Al momento della stesura, una H100 si noleggia on-demand a 3,85 $ l'ora su Nebius, 6,88 $ su AWS (la p5.4xlarge a singola GPU in us-east-1 — la p5.48xlarge a 8 GPU costa 55,04 $, esattamente otto volte tanto), 10,98 $ su GCP (a3-highgpu-8g, us-central1) e 12,29 $ su Azure (ND96isr, East US). Un divario di 3,2x sullo stesso identico silicio.
E in realtà non si noleggia una GPU: si noleggia una scatola da otto. Quasi tutte le istanze GPU serie vengono fornite come nodi da 8 GPU, quindi la domanda di dimensionamento è "quanti nodi", non "quante GPU". Un nodo, attivo 24 ore su 24 per un mese:
| $/GPU-ora | Nodo/mese (~730 ore) | |
|---|---|---|
| Nebius spot | 2,15 $ | ~12.600 $ |
| Nebius on-demand | 3,85 $ | ~22.500 $ |
| AWS on-demand | 6,88 $ | ~40.200 $ |
| GCP on-demand | 10,98 $ | ~64.100 $ |
| Azure on-demand | 12,29 $ | ~71.800 $ |
Stesse GPU, stesso mese, 59.000 dollari di differenza tra un estremo e l'altro della tabella. Due correzioni prima di ancorarsi a uno dei due estremi. I commitments riducono il divario: una reservation AWS a 1 anno porta il nodo a circa 43 $ l'ora (all'incirca 31.600 $ al mese), i Capacity Blocks si sono recentemente attestati intorno ai 5,20 $ per GPU-ora e i commitments triennali degli hyperscaler possono all'incirca dimezzare l'on-demand. E l'estremo più economico ha i suoi compromessi: lo Spot può essere revocato a metà richiesta — e in un mercato a corto di capacità potrebbe semplicemente non essere disponibile quando serve — mentre ai provider low-cost manca l'ecosistema che il Suo platform team già conosce. Se tutto questo valga 30.000 dollari al mese è una discussione legittima, ma dovrebbe essere una discussione, non un default.
Dove passa la linea
Ora le due curve possono incontrarsi. Un nodo 8xH100 saturo che serve un modello open-weight di classe 120B in continuous batching produce diversi miliardi di token in output al mese — token che alle tariffe di Sonnet 5 verrebbero fatturati per svariate decine di migliaia di dollari, da un nodo che costa da 12.600 a 40.200 dollari. La regola empirica ne discende direttamente: quando la Sua spesa AI a consumo per il lavoro che un modello open-weight gestisce davvero — ad alto volume, ripetitivo, valutabile — si mantiene sopra all'incirca il prezzo mensile di un nodo, il self-hosting è più economico, e il vantaggio cresce con il volume. A 2.200 dollari per sviluppatore, quella linea si colloca da qualche parte tra i sette e i diciotto sviluppatori.
Prima che qualcuno lo inoltri a un CFO, due aggiunte oneste che alzano l'asticella. Se Le serve la disponibilità che un'API Le dà gratis, metta in conto due nodi, non uno: con una sola replica un riavvio mette fuori uso l'assistente per tutti. E qualcuno deve gestirlo — model serving, quantizzazione, failover, aggiornamenti — quindi inserisca il costo aziendale pieno di un engineer nel confronto, non in una nota a piè di pagina. Con entrambe le correzioni, la linea onesta è una spesa sostenuta ben al di sopra del prezzo di due nodi e di una parte di un engineer — che ai livelli di utilizzo reali corrisponde comunque solo al workload agentico di poche decine di sviluppatori.
Il caso limite che salta del tutto i calcoli: se il Suo codice o i Suoi dati non possono uscire dal Suo perimetro, il self-hosting non è mai stato una decisione di costo, e la soglia è dove la colloca il Suo team di compliance.
La prova del nove per dimensione del team
Le dimensioni del team rendono comunque i calcoli concreti, purché il dimensionamento si basi sulle sessioni concorrenti e non sull'organico: gli sviluppatori generano a raffiche, e in ogni istante forse il 10-20 percento di un team ha una richiesta in corso.
Dieci sviluppatori significano due o tre sessioni concorrenti — nella migliore delle ipotesi metà della capacità di un nodo. La bolletta dell'assistente al nostro livello di utilizzo è di ~22.000 $ al mese contro 12.600-40.200 $ per un nodo che il team non riesce a tenere occupato: più o meno un pareggio, e con l'abbonamento si compra un modello frontier, quindi vince comunque. A questa dimensione non faccia self-hosting, a meno che non si applichi il vincolo del perimetro dei dati.
Cinquanta sviluppatori significano da cinque a dieci sessioni concorrenti — un singolo nodo 8xH100 serve l'intero team per modelli fino alla classe 120B. La bolletta dell'assistente all'utilizzo reale è di ~110.000 $ al mese contro lo stesso nodo: da tre a nove volte il puro hardware.
Cloud bill shouldn't be a mystery
One platform for AI and Cloud optimization.
Cento sviluppatori significano due o tre nodi, da 45.000 a 80.000 $ al mese noleggiati on-demand, contro una bolletta dell'assistente di ~220.000 $. È anche il punto in cui entra in scena l'acquisto dell'hardware. Un server 8xH100 costa circa 280.000 $; ammortizzato linearmente su tre anni fa 7.800 $ al mese, diciamo 10.000-12.000 $ con energia, colocation e operations, quindi contro i 40.200 $ dell'on-demand AWS l'hardware si ripaga entro un anno. Sia chiaro con il Suo team finance che si tratta di un puro calcolo di payback di cassa — l'ammortamento lineare a tre anni è il piano di ammortamento, senza costo del capitale né stime di valore residuo. La controargomentazione è l'utilizzo: quel payback presuppone che il nodo giri a pieno regime 24 ore su 24, e un workload occupato 50 ore a settimana usa il 30 percento delle ore acquistate — a quel punto la Sua tariffa on-prem effettiva triplica, il cloud Le permette di non pagare notti e weekend, e i prezzi reserved colmano gran parte del divario rimanente. Possedere vince quando l'utilizzo è alto e prevedibile; noleggiare vince quando non lo è. Il foglio di calcolo di solito dice "compra"; i dati di utilizzo di solito dicono "noleggia". Si fidi dei dati di utilizzo.
Che cosa compra davvero il sovrapprezzo
A cinquanta sviluppatori, il divario tra la bolletta dell'assistente e il nodo è di circa 70.000-100.000 $ al mese. Non è solo un sovrapprezzo per l'etichetta sul modello: l'API a consumo include la resilienza che altrimenti comprerebbe sotto forma di un secondo nodo, l'elasticità che altrimenti comprerebbe come capacità di riserva inattiva, il rischio di capacità a carico di qualcun altro, strumenti di sicurezza e supporto, aggiornamenti del modello senza refresh dell'hardware e zero rischio di ritrovarsi con hardware inutilizzato quando il modello dell'anno prossimo vorrà le GPU dell'anno prossimo. Altri due punti a favore: il modello frontier risolve più problemi per tentativo — in termini di costo per pull request merged una parte del multiplo si riduce, e solo la Sua eval dice quanto — e i prezzi di listino dei token continuano a scendere sotto la pressione dei provider frontier a basso costo, quindi il lato API di questo confronto migliora da solo in un modo che un commitment GPU firmato non fa.
Il contrappeso favorisce il self-hosting esattamente dove si applica: la prevedibilità. La spesa per sviluppatore è il lato volatile di questo bilancio — la nostra è cresciuta ogni mese — mentre un nodo a noleggio è una cifra fissa e nota. Per il lavoro ad alto volume e valutabile che comunque appartiene a un modello open-weight, sta scambiando una spesa senza tetto con una cifra piatta. Anche riconoscendo tutto ciò che il sovrapprezzo compra, il divario oltre i cinquanta sviluppatori resta abbastanza ampio da finanziare l'engineer che gestisce il nodo.
Cosa fare concretamente
La conclusione è un portafoglio, non una scelta di campo:
- Postazioni con tetto per gli utenti leggeri — a 100 $ a testa, non c'è niente di meglio.
- API frontier a consumo per i problemi che richiedono davvero qualità frontier — paghi il sovrapprezzo dove l'eval dice che se lo guadagna.
- Un nodo open-weight self-hosted per il lavoro ad alto volume, ripetitivo e valutabile — a partire dal giorno in cui la Sua spesa a consumo sostenuta per quel lavoro supera il prezzo del nodo (o di due nodi più un engineer, se vuole essere onesto su disponibilità e operations).
- Self-hosting a prescindere dal costo quando il codice non può uscire dal Suo perimetro.
Con numeri di utilizzo enterprise reali, la maggior parte dei team varca la soglia del self-hosting prima di quanto lascerebbero intendere le pagine dei prezzi — e i vendor.
Faccia i Suoi calcoli
In qualunque fascia si trovi, quattro input dominano il risultato: quale modello (il numero di parametri fissa la soglia minima di GPU), la quantizzazione (FP8 dimezza la memoria di FP16, INT4 la dimezza di nuovo, ognuna con un costo in qualità), la lunghezza del contesto (la KV cache per contesti lunghi può rivaleggiare con i pesi in termini di memoria) e l'obiettivo di concorrenza (determina le repliche, che moltiplicano tutto quanto sopra).
Ci siamo stancati di ricostruire questo foglio di calcolo a ogni conversazione con un cliente, quindi lo abbiamo messo sul web: il calcolatore di hosting AI dimensiona uno qualsiasi di ~29 modelli open-weight rispetto ai prezzi GPU correnti, estratti a intervalli regolari dalle API di pricing dei provider stessi, accanto a una stima di build on-prem. Ogni numero qui sopra viene da lì, e ogni numero al suo interno riconduce a una formula o a un'ipotesi esplicita che può contestare.
I prezzi in questo articolo sono una fotografia del momento (agosto 2026, regioni di riferimento indicate sopra) e cambieranno — i noleggi GPU in una direzione, i prezzi dei token molto probabilmente nell'altra. Se il Suo team si trova da qualche parte tra "il thread che è morto" e "tre nodi e un contratto di colocation", faccia i Suoi calcoli prima che una delle due fazioni vinca per default.