Tokens, contexte et tarification
- Compter correctement les tokens avec l'outillage d'Anthropic (pas le tokeniseur d'un autre modèle)
- Distinguer max_tokens de la fenêtre de contexte — et pourquoi la différence compte
- Estimer le coût de l'API à partir des tokens en entrée + en sortie, aux tarifs par modèle
- Réduire le coût sans perdre en qualité : bien dimensionner, mettre en cache, élaguer, regrouper en lots
Le coût et les limites sur l'API se mesurent tous en tokens (~¾ d'un mot). Trois choses à bien faire.
1. Compter correctement les tokens
Ne devinez pas, et n'utilisez pas le tokeniseur d'un autre modèle (par ex. tiktoken) — les décomptes de tokens diffèrent selon la famille de modèles. Utilisez l'endpoint/l'aide du SDK de comptage de tokens d'Anthropic pour mesurer une requête avant de l'envoyer.
- Règle de planification approximative : ~750 mots ≈ ~1 000 tokens (un token vaut environ ¾ d'un mot).
2. max_tokens ≠ fenêtre de contexte
Ces deux limites sont faciles à confondre, mais elles régissent des choses différentes.
| Limite | Ce qu'elle plafonne | Quand la modifier |
|---|---|---|
max_tokens | La longueur de la réponse (sortie uniquement) | Augmentez-la si la sortie est tronquée |
| Fenêtre de contexte | Budget total pour l'entrée + la sortie | De grosses entrées laissent moins de place à la sortie |
- Réglez max_tokens sur ce dont la tâche a besoin. Trop bas tronque la réponse. Inutilement haut ne coûte pas plus cher — vous ne payez que pour les tokens réellement générés — mais cela peut laisser les réponses partir dans tous les sens.
3. Estimer le coût
Vous êtes facturé pour les tokens en entrée + tokens en sortie, aux tarifs par modèle (Opus > Sonnet > Haiku). Une estimation rapide :
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
Obtenez les tarifs actuels sur la page officielle de tarification — nous ne les codons pas en dur ici, volontairement.
Réduire le coût (sans perdre en qualité)
- Commencez avec Sonnet ; réservez Opus pour les parties difficiles. Voir Choisir un modèle (/docs/api/choosing-a-model).
- Réutilisez un préfixe de prompt stable d'un appel à l'autre. Voir Mise en cache des prompts (/docs/api/prompt-caching).
- N'envoyez que le contexte qui compte. C'est aussi là que le RAG (/docs/foundations/rag) aide.
- Regroupez en lots les tâches où la latence n'a pas d'importance.
Plus de stratégie dans Compromis coût & latence.
Vérifiez vos acquis
0/4- Tout se mesure en tokens (~¾ d'un mot) ; ~750 mots ≈ ~1 000 tokens.
- Comptez les tokens avec l'outillage d'Anthropic — jamais le tokeniseur d'un autre modèle.
- max_tokens plafonne la réponse ; la fenêtre de contexte est le budget total entrée + sortie.
- Facturation = tokens en entrée + tokens en sortie aux tarifs par modèle (Opus > Sonnet > Haiku).
- Réduisez le coût en dimensionnant bien le modèle, en mettant en cache les préfixes, en élaguant les entrées et en regroupant en lots.