Cloud Intelligence™Cloud Intelligence™

Cloud Intelligence™

Vos développeurs veulent un LLM auto-hébergé. Votre CFO veut les chiffres.

Le seuil de rentabilité de l'auto-hébergement d'un LLM n'est pas une taille d'équipe : c'est un niveau de dépense — et avec des données d'usage réelles en entreprise, il arrive plus tôt que les pages tarifaires ne le laissent penser. Voici le calcul, de l'écart de 3,2x sur les prix de location des H100 jusqu'au mois où votre facture API dépasse celle d'un nœud GPU

Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.

Aug 18, 20268 min read

Cet article vous dit combien coûte votre stack IA. Attribute vous dit à quelles équipes et à quels produits ce coût revient.

Vadim Solovey

About Vadim Solovey

Founded DoiT in 2011 and have been here ever since — in every flavor of CTO, co-CEO, and now CEO. I started my career in 1999 building data centers before anyone called it "the cloud," and I've spent the two decades since trying to deliver on what the cloud was actually supposed to be. I still write code most weeks.

My personal page

Sur le papier, les tarifs semblent imbattables. Claude Code coûte entre 100 et 200 $ par mois avec les forfaits Max, ou 100 $ par siège facturé annuellement en Team Premium ; Codex se situe dans la même fourchette. Cinquante développeurs coûtent 5 000 à 10 000 $ par mois, une fraction de n'importe quel cluster GPU capable de les servir, et le débat sur l'auto-hébergement s'arrêterait là.

Mais ces forfaits imposent des plafonds d'utilisation stricts, et l'usage sérieux n'a plus rien d'humain. Un agent en arrière-plan qui relit chaque pull request, un balayage nocturne de codemods sur 400 dépôts, un pipeline CI qui génère et répare des tests : tout cela tourne en tarification à l'usage (au tarif public, 3 $ par million de tokens en entrée et 15 $ par million en sortie pour Sonnet 5 ; 5 $ et 25 $ pour Opus 5), personne ne les plafonne pour vous, et la facture évolue avec l'ambition, pas avec les effectifs.

Nous pouvons chiffrer ce basculement, parce que nous l'avons vécu. Au sein de l'équipe d'ingénierie de DoiT, en tarification à l'usage Claude Code Enterprise, la moyenne atteint désormais environ 2 200 $ par développeur et par mois. Pas le plafond — la moyenne — et rien de figé : elle a augmenté chaque mois à mesure que les workflows agentiques se généralisent, sans plateau en vue. Votre chiffre sera différent — une équipe d'utilisateurs légers sur des forfaits plafonnés coûte vraiment 100 $ par tête, et si c'est votre cas, l'abonnement gagne et vous pouvez arrêter votre lecture ici — mais la courbe va dans le même sens partout où nous regardons. La vraie question n'est donc pas de savoir si dix développeurs devraient louer un GPU, mais à partir de quel niveau de dépense soutenue un nœud loué bat une API à l'usage pour le travail qu'un modèle open-weight peut réellement prendre en charge.

Ce que coûte réellement un nœud

Les prix des GPU sont vraiment difficiles à comparer. À l'heure où nous écrivons ces lignes, un H100 se loue à la demande 3,85 $ de l'heure chez Nebius, 6,88 $ sur AWS (l'instance mono-GPU p5.4xlarge en us-east-1 — la p5.48xlarge à 8 GPU est à 55,04 $, exactement huit fois plus), 10,98 $ sur GCP (a3-highgpu-8g, us-central1) et 12,29 $ sur Azure (ND96isr, East US). Soit un écart de 3,2x sur un silicium identique.

Et en réalité, on ne loue pas un GPU — on loue une machine qui en contient huit. Presque toutes les instances GPU sérieuses se présentent sous forme de nœuds à 8 GPU ; la question du dimensionnement n'est donc pas le nombre de GPU, mais le nombre de nœuds. Un nœud, en continu pendant un mois :

$/GPU-h Nœud/mois (~730 h)
Nebius Spot 2,15 $ ~12 600 $
Nebius à la demande 3,85 $ ~22 500 $
AWS à la demande 6,88 $ ~40 200 $
GCP à la demande 10,98 $ ~64 100 $
Azure à la demande 12,29 $ ~71 800 $

Les mêmes GPU, le même mois, et 59 000 $ d'écart entre les extrêmes du tableau. Deux ajustements avant de vous arrêter sur l'un ou l'autre. Les commitments resserrent l'écart : une réservation AWS d'un an ramène le nœud à environ 43 $ de l'heure (soit à peu près 31 600 $ par mois), les Capacity Blocks se sont récemment négociés autour de 5,20 $ par GPU-heure, et les commitments hyperscaler sur 3 ans peuvent en gros diviser par deux le tarif à la demande. Et l'option la moins chère a ses contreparties : une instance Spot peut être récupérée en pleine requête — et, dans un marché où la capacité est rare, peut tout simplement ne pas être disponible quand vous en avez besoin — tandis que les fournisseurs low-cost n'offrent pas l'écosystème que votre équipe plateforme maîtrise déjà. Savoir si cela vaut 30 000 $ par mois est une vraie discussion, mais cela doit rester une discussion, pas un choix par défaut.

Où se situe le seuil

Les deux courbes peuvent maintenant se croiser. Un nœud 8xH100 saturé, servant un modèle open-weight de classe 120B en continuous batching, produit plusieurs milliards de tokens de sortie par mois — des tokens qui, aux tarifs de Sonnet 5, seraient facturés plusieurs dizaines de milliers de dollars, depuis un nœud qui coûte entre 12 600 et 40 200 $. La règle empirique en découle directement : dès que votre dépense IA à l'usage, sur du travail qu'un modèle open-weight prend réellement en charge — volumineux, répétitif, évaluable — se maintient à peu près au-dessus du prix mensuel d'un nœud, l'auto-hébergement est moins cher, et l'avantage s'amplifie avec le volume. À 2 200 $ par développeur, ce seuil se situe quelque part entre sept et dix-huit développeurs.

Avant que quiconque ne transmette cela à un CFO, deux précisions honnêtes qui relèvent la barre. Si vous avez besoin de la disponibilité qu'une API vous offre gratuitement, chiffrez deux nœuds, pas un : avec une seule réplique, un redémarrage prive tout le monde de l'assistant. Et il faut quelqu'un pour le faire tourner — model serving, quantization, failover, mises à niveau — donc intégrez le coût chargé d'un ingénieur dans la comparaison, pas en note de bas de page. Avec ces deux ajustements, le seuil honnête est une dépense soutenue confortablement supérieure au prix de deux nœuds et d'une fraction d'ingénieur — ce qui, aux taux d'usage réels, ne représente encore que quelques dizaines de développeurs en workloads agentiques.

Le cas limite qui court-circuite tout le calcul : si votre code ou vos données ne peuvent pas quitter votre périmètre, l'auto-hébergement n'a jamais été une décision de coût, et le point de bascule se trouve là où votre équipe conformité le place.

Le test de cohérence par taille d'équipe

Les tailles d'équipe rendent malgré tout le calcul concret, à condition de dimensionner selon la simultanéité plutôt que selon les effectifs : les développeurs génèrent par rafales, et à tout instant, seuls 10 à 20 % d'une équipe environ ont une requête en cours.

Dix développeurs, c'est deux ou trois sessions simultanées — au mieux la moitié de la capacité d'un nœud. La facture d'assistant à notre niveau d'usage atteint ~22 000 $ par mois contre 12 600 à 40 200 $ pour un nœud que l'équipe ne parvient pas à saturer : à peu près l'équilibre, et l'abonnement vous donne accès à un modèle frontière, donc il gagne quand même. N'auto-hébergez pas à cette taille, sauf si la contrainte de périmètre de données s'applique.

Cinquante développeurs, c'est cinq à dix sessions simultanées — un seul nœud 8xH100 sert toute l'équipe pour des modèles jusqu'à la classe 120B. La facture d'assistant à usage réel est de ~110 000 $ par mois contre le même nœud : trois à neuf fois le prix du matériel.

Cent développeurs, c'est deux ou trois nœuds, 45 000 à 80 000 $ par mois en location à la demande, contre une facture d'assistant d'environ 220 000 $. C'est aussi là que la possession du matériel entre en jeu. Un serveur 8xH100 coûte environ 280 000 $ ; amorti linéairement sur trois ans, cela fait 7 800 $ par mois — disons 10 000 à 12 000 $ avec l'électricité, la colocation et l'exploitation —, donc face aux 40 200 $ du tarif à la demande AWS, le matériel se rentabilise en moins d'un an. Soyez clair avec votre équipe finance : il s'agit d'un pur calcul de retour sur trésorerie — l'amortissement linéaire sur trois ans est le plan d'amortissement, sans coût du capital ni hypothèse de valeur résiduelle. Le contre-argument, c'est l'utilisation : ce retour suppose que le nœud tourne à plein régime jour et nuit, et un workload actif 50 heures par semaine n'utilise que 30 % des heures achetées — auquel cas votre tarif on-prem effectif triple, le cloud vous permet de ne pas payer les nuits et les week-ends, et les tarifs réservés comblent l'essentiel de l'écart restant. L'achat l'emporte quand l'utilisation est élevée et prévisible ; la location l'emporte quand elle ne l'est pas. Le tableur recommande généralement l'achat ; les données d'utilisation, généralement la location. Faites confiance aux données d'utilisation.

Cloud bill shouldn't be a mystery

One platform for AI and Cloud optimization.

Ce que le surcoût vous apporte vraiment

À cinquante développeurs, l'écart entre la facture d'assistant et le nœud est d'environ 70 000 à 100 000 $ par mois. Ce n'est pas seulement une prime pour l'étiquette du modèle — l'API à l'usage inclut la résilience que vous achèteriez sinon sous forme de second nœud, l'élasticité que vous achèteriez sinon sous forme de marge inutilisée, un risque de capacité porté par quelqu'un d'autre, l'outillage de sécurité et le support, des mises à niveau de modèle sans renouvellement matériel, et aucun risque de vous retrouver avec du matériel sur les bras quand le modèle de l'an prochain réclamera les GPU de l'an prochain. Deux autres points à mettre à son crédit : le modèle frontière résout plus de problèmes par tentative — en coût par pull request fusionnée, une partie de l'écart se referme, et seules vos propres évaluations diront de combien — et les tarifs publics des tokens continuent de baisser sous la pression de fournisseurs frontière moins chers, si bien que le côté API de cette comparaison s'améliore de lui-même, d'une façon qu'un commitment GPU signé ne permet pas.

Le contrepoids joue en faveur de l'auto-hébergement exactement là où il s'applique : la prévisibilité. La dépense par développeur est la partie volatile de l'équation — la nôtre a augmenté chaque mois — tandis qu'un nœud loué est un montant fixe et connu. Pour le travail volumineux et évaluable qui a de toute façon sa place sur un modèle open-weight, vous échangez une facture sans plafond contre une facture fixe. Après avoir crédité tout ce que le surcoût apporte, l'écart au-delà de cinquante développeurs reste assez large pour financer l'ingénieur qui fait tourner le nœud.

Que faire concrètement

La conclusion est un portefeuille, pas un camp :

  • Des sièges plafonnés pour les utilisateurs légers — à 100 $ par tête, rien ne les bat.
  • Une API frontière à l'usage pour les problèmes qui exigent réellement la qualité frontière — payez le surcoût là où vos évaluations montrent qu'il se justifie.
  • Un nœud open-weight auto-hébergé pour le travail volumineux, répétitif et évaluable — dès le jour où votre dépense à l'usage soutenue sur ce travail dépasse le prix du nœud (ou de deux nœuds plus un ingénieur, si vous êtes honnête sur la disponibilité et l'exploitation).
  • L'auto-hébergement quel qu'en soit le coût quand le code ne peut pas quitter votre périmètre.

Avec des chiffres d'usage réels en entreprise, la plupart des équipes franchissent le seuil de l'auto-hébergement plus tôt que ne le suggèrent les pages tarifaires — et les fournisseurs.

Faites vos propres calculs

Quel que soit votre palier, quatre paramètres dominent le résultat : le modèle (le nombre de paramètres fixe le plancher GPU), la quantization (le FP8 divise par deux la mémoire du FP16, l'INT4 la divise encore par deux, chacun avec un coût en qualité), la longueur de contexte (le cache KV des contextes longs peut rivaliser en mémoire avec les poids du modèle) et l'objectif de simultanéité (il détermine le nombre de répliques, qui multiplient tout ce qui précède).

Nous en avons eu assez de reconstruire ce tableur à chaque conversation client, alors nous l'avons mis en ligne : le calculateur d'hébergement IA dimensionne chacun des quelque 29 modèles open-weight face aux prix GPU actuels, récupérés à intervalles réguliers depuis les API de tarification des fournisseurs eux-mêmes, à côté d'une estimation de déploiement on-prem. Chaque chiffre de cet article en provient, et chaque chiffre affiché remonte à une formule ou à une hypothèse explicite que vous pouvez contester.

Les prix de cet article sont un instantané (août 2026, régions de référence citées plus haut) et évolueront — les tarifs de location des GPU dans un sens, les prix des tokens très probablement dans l'autre. Si votre équipe se situe quelque part entre le fil de discussion resté sans suite et trois nœuds avec un contrat de colocation, faites vos propres calculs avant que l'un des deux camps ne gagne par défaut.