Ce que l'IA coûte réellement (selon les fournisseurs)
« Combien coûte l'IA ? » n'a pas de réponse unique — cela dépend de quel archétype de tarification vous achetez et de combien vous l'utilisez réellement. Les montants en dollars changent tous les quelques mois ; la structure du coût, elle, ne bouge presque pas. Cette page enseigne la forme durable : les trois façons dont l'IA est facturée, comment estimer une charge de travail avant de la construire, les leviers qui réduisent la facture, et la vraie bifurcation entre louer une API et auto-héberger.
- Distinguer les trois archétypes de coût : API au token, abonnement forfaitaire, et open/auto-hébergé
- Estimer le coût de n'importe quelle charge de travail à partir de tokens × tarif × volume — avant de la déployer
- Actionner les grands leviers qui réduisent la dépense sans nuire à la qualité
- Savoir quand l'open/auto-hébergé bat l'API sur le coût, et quand l'API l'emporte
- Savoir quels chiffres deviennent vite obsolètes — et où vérifier la vérité du jour
Les trois archétypes de coût
Presque toutes les façons de payer l'IA se ramènent à l'une de trois formes. Apprenez les formes, pas les prix.
- API au token (basée sur l'usage). Vous appelez un modèle hébergé via une API et payez au token — et l'entrée et la sortie sont tarifées séparément, la sortie étant presque toujours la plus chère des deux. Les modèles plus grands/plus intelligents coûtent plus par token ; les modèles plus petits coûtent bien moins. La plupart des fournisseurs proposent aussi des remises : un tarif réduit pour l'entrée mise en cache que vous renvoyez, et une remise batch forfaitaire pour les tâches asynchrones non urgentes. C'est ainsi que vous payez quand vous construisez un produit sur Claude, GPT ou Gemini. Le coût évolue directement avec l'usage — quelques centimes à petite échelle, le poste dominant à grande échelle.
- Abonnement forfaitaire grand public/par siège. Un forfait mensuel fixe pour une application de chat ou un assistant d'IDE (les offres grand public de Claude / ChatGPT / Gemini, les sièges de type Copilot). Vous ne voyez pas les tokens ; vous avez un quota d'usage et des limites de débit. Prévisible et bon marché pour un humain devant un clavier — mais ne passe pas à l'échelle pour le travail programmatique/à haut volume, et les coûts par siège s'additionnent au sein d'une équipe.
- Open / local (auto-hébergé). Vous exécutez un modèle à poids ouverts (Llama, Mistral, Qwen, DeepSeek) sur votre propre matériel ou un GPU loué. Il n'y a aucun prix par appel — vous payez le matériel (ou la location horaire du GPU) + l'électricité + l'exploitation, que le modèle soit occupé ou inactif. Le coût marginal d'un appel supplémentaire est en pratique quasi nul à l'échelle, mais vous portez un coût fixe et une charge opérationnelle. Voir Exécuter des modèles localement avec Ollama.
- La distinction clé : l'API et les abonnements sont un coût MARGINAL (vous payez à l'usage) ; l'auto-hébergement est surtout un coût FIXE (vous payez pour maintenir la capacité, utilisée ou non).
- Sur l'API, la plus grande surprise est que les tokens de SORTIE coûtent généralement plusieurs fois plus que ceux d'entrée — les réponses bavardes coûtent vraiment de l'argent.
- Un abonnement forfaitaire est le bon outil pour un humain qui discute ; l'API au token est le bon outil pour une application qui appelle le modèle en boucle.
Comment estimer le coût d'une charge de travail
Vous pouvez dimensionner une facture d'API avant d'écrire une ligne de code de production. Tout le modèle tient en une formule :
coût ≈ (tokens d'entrée × tarif d'entrée) + (tokens de sortie × tarif de sortie), par appel × nombre d'appels
Les tarifs sont indiqués par million de tokens, et l'entrée et la sortie ont des tarifs différents — estimez donc les deux moitiés séparément puis additionnez-les. Règle empirique approximative pour les tokens : ~1 token ≈ 4 caractères d'anglais, ou ~0,75 mot. Pour des comptes exacts, utilisez la zone Estimateur de tokens et lisez Tokens et tarification. Toute la mécanique de l'endroit où se cachent les tokens se trouve dans L'économie des tokens.
- Additionnez l'entrée : prompt système + outils + contexte récupéré + historique + le tour de l'utilisateur. Puis estimez la sortie que vous demandez. Comptez l'entrée et la sortie séparément — elles sont tarifées différemment.
- tokens d'entrée × tarif d'entrée, plus tokens de sortie × tarif de sortie. Utilisez les chiffres du jour par million tirés de la page de tarification du fournisseur (ne vous fiez pas à un chiffre mémorisé — voir VerifyNote).
- Multipliez le coût par appel par le nombre d'appels par jour × jours. Un coût dérisoire par appel (fractions de centime) devient votre principal poste à des millions d'appels — modélisez votre trafic RÉEL, pas une seule requête.
- Si une grande partie de l'entrée se répète à chaque appel, tarifez-la au tarif MIS EN CACHE, pas au plein tarif d'entrée. Si la tâche est hors ligne, appliquez la remise BATCH. Elles changent radicalement le résultat à l'échelle.
- Comparez vos hypothèses de coût au token à un traqueur indépendant et à notre Calculateur de coût, puis attaquez la facture avec les leviers ci-dessous.
Estimation au dos de l'enveloppe (renseignez les tarifs du jour)
Per call:
input_tokens = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens * input_rate_per_million / 1e6)
+ (output_tokens * output_rate_per_million / 1e6)
Per month:
monthly_cost = call_cost * calls_per_day * 30
Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.Les grands leviers pour réduire le coût
La plupart des charges de travail réelles trimballent du poids mort. Ces leviers, à peu près par ordre d'effet, réduisent la dépense sans toucher à la qualité — actionnez d'abord les leviers structurels peu coûteux.
- Dimensionner correctement le modèle. Ne payez pas un tarif de modèle phare pour une tâche qu'un petit modèle bon marché accomplit très bien. La classification, l'extraction, le routage et le simple formatage tournent généralement très bien sur le plus petit palier à une fraction du prix au token. Réservez le grand modèle au raisonnement réellement difficile, et envisagez le routage : le modèle bon marché traite la majorité facile, on n'escalade que les cas difficiles. Voir Choisir un modèle.
- Élaguer le contexte que vous envoyez. Le token le moins cher est celui que vous n'envoyez jamais. Élaguez les prompts système gonflés, compactez les longs historiques en un résumé courant, et n'exposez que les outils dont la tâche a besoin — chacun est de l'entrée que vous repayez à chaque appel.
- RAG plutôt que d'entasser un énorme contexte. Coller un document de 50 pages pour répondre à une seule question fait payer 50 pages à chaque appel. La récupération ne va chercher que les quelques passages pertinents — bien moins de tokens d'entrée pour la même réponse (souvent meilleure). Ne recourez à une gigantesque fenêtre de contexte que lorsque vous avez réellement besoin d'avoir tout le corpus en vue à la fois.
- Mise en cache des prompts. Si de nombreux appels partagent un grand préfixe inchangé (prompt système, catalogue d'outils, document de référence), la mise en cache le traite une fois et le ressert à forte remise à chaque appel ultérieur. Le changement structurel à plus fort effet pour les charges de chat et d'agent, car il rapporte à chaque tour.
- Batcher le non urgent. Évaluations, étiquetage en masse, résumé d'une archive — tout ce dont vous n'avez pas besoin en quelques secondes — passe par une voie batch asynchrone à remise forfaitaire chez la plupart des fournisseurs. Échangez l'immédiateté contre une facture sensiblement plus basse.
- Raccourcir la sortie. La sortie est le côté le plus cher. Demandez du JSON ou un schéma serré plutôt qu'un paragraphe bavard : moins de tokens de sortie et aucune devinette d'analyse en aval.
- Modèles plus petits / ouverts pour la part facile. Pour la majorité des appels à haut volume et faible difficulté, un modèle ouvert ou petit peut être bien moins cher par appel — parfois quasi gratuit si vous auto-hébergez déjà. Gardez le modèle de pointe pour les cas qui en ont réellement besoin.
- Ces leviers se multiplient : entrée mise en cache × modèle bien dimensionné × sortie plus concise × remise batch se composent en une grande réduction totale sur une tâche facile — sans changer la qualité.
- Actionnez les leviers structurels (bon dimensionnement, cache, RAG, batch) avant de micro-optimiser la formulation — ils font bien plus bouger la facture.
- MESUREZ toujours le changement face à la facture réelle, pas à une supposition. Le guide approfondi est L'économie des tokens.
Quand l'open/auto-hébergé bat l'API — et quand l'API l'emporte
C'est la décision qui fait réellement bouger votre budget IA. C'est un croisement entre coût fixe et coût marginal, et le volume est la variable qui décide.
- L'open / auto-hébergé l'emporte à VOLUME élevé et stable. Une fois que vous exécutez assez d'appels pour garder un GPU occupé la plupart du temps, le coût marginal quasi nul par appel bat le fait de payer au token pour toujours. Vous amortissez le coût fixe matériel/location sur un très grand nombre d'appels, gagnez en confidentialité des données et en personnalisation totale — et acceptez la charge opérationnelle (provisionnement, mise à l'échelle, disponibilité, MLOps) comme prix d'entrée.
- L'API l'emporte à volume FAIBLE ou EN PICS, ou sans infra. Si le trafic est faible, en rafales ou imprévisible, payer au token signifie que vous ne payez que ce que vous utilisez et rien lorsque le système est inactif — pas de GPU qui chauffe à 3 h du matin. Vous évitez aussi toute l'exploitation. Pour la plupart des équipes qui livrent un produit, prototypent, ou dont le trafic arrive par pics, l'API est à la fois moins chère et bien moins de travail.
- L'auto-hébergement est rarement « gratuit ». Les poids du modèle peuvent être gratuits, mais les GPU, l'électricité et les heures d'ingénieur pour le maintenir en marche ne le sont pas — comptez-les honnêtement avant de revendiquer une économie.
- Les GPU inactifs sont une pure perte : une infra à coût fixe ne bat la tarification au token que lorsque l'utilisation est ÉLEVÉE. Un trafic faible ou en pics favorise l'API à chaque fois.
- Le point de croisement bouge dès que les prix de l'API baissent ou que le matériel devient moins cher — refaites le calcul périodiquement, ne décidez pas une fois pour toutes.
Vérifiez vos acquis
0/3- Trois archétypes : API au token (basée sur l'usage, entrée vs sortie tarifées séparément), abonnement forfaitaire (prévisible, ne passe pas à l'échelle à haut volume), et open/auto-hébergé (coût fixe, quasi nul par appel).
- Estimez avant de construire : (entrée × tarif d'entrée) + (sortie × tarif de sortie), par appel × volume — puis appliquez les remises cache et batch.
- Plus grands leviers : bien dimensionner le modèle, élaguer le contexte, RAG plutôt qu'un énorme contexte, mise en cache des prompts, batcher le non urgent, raccourcir la sortie.
- L'auto-hébergement l'emporte à VOLUME élevé et stable (amortir le coût fixe) ; l'API l'emporte à volume FAIBLE/en pics ou sans infra (ne payer que l'usage).
- Chaque montant en dollars devient vite obsolète — vérifiez sur la page de tarification du fournisseur et sur un traqueur, et faites vos propres calculs dans le Calculateur de coût.
Sources et lectures complémentaires
- Anthropic — Tarification — tarifs au token Claude actuels, remises cache et batch.
- OpenAI — Tarification de l'API · OpenAI — Aperçu de la tarification — tarifs au token et paliers GPT actuels.
- Google — Tarification de l'API Gemini — tarifs Gemini actuels, palier gratuit et paliers payants.
- Mistral — Tarification — tarification à poids ouverts + API, un point de référence axé sur l'efficacité.
- Artificial Analysis — comparaisons indépendantes et fréquemment mises à jour du prix/vitesse/qualité entre fournisseurs (le traqueur pour vérifier tout chiffre cité).
- Ollama — exécutez des modèles à poids ouverts localement pour ramener le prix par appel vers zéro à l'échelle.
Suite
- Choisir le bon modèle (et au bon prix) → Choisir un modèle
- Trouver où les tokens fuient réellement → L'économie des tokens
- La mécanique au token en profondeur → Tokens et tarification
- Faire vos propres calculs → Calculateur de coût