Aller au contenu principal

Tokens, contexte et tarification

Débutant
What you'll learn
  • Compter correctement les tokens avec l'outillage d'Anthropic (pas le tokeniseur d'un autre modèle)
  • Distinguer max_tokens de la fenêtre de contexte — et pourquoi la différence compte
  • Estimer le coût de l'API à partir des tokens en entrée + en sortie, aux tarifs par modèle
  • Réduire le coût sans perdre en qualité : bien dimensionner, mettre en cache, élaguer, regrouper en lots

Le coût et les limites sur l'API se mesurent tous en tokens (~¾ d'un mot). Trois choses à bien faire.

1. Compter correctement les tokens

Ne devinez pas, et n'utilisez pas le tokeniseur d'un autre modèle (par ex. tiktoken) — les décomptes de tokens diffèrent selon la famille de modèles. Utilisez l'endpoint/l'aide du SDK de comptage de tokens d'Anthropic pour mesurer une requête avant de l'envoyer.

Pro tip
  • Règle de planification approximative : ~750 mots ≈ ~1 000 tokens (un token vaut environ ¾ d'un mot).

2. max_tokens ≠ fenêtre de contexte

Ces deux limites sont faciles à confondre, mais elles régissent des choses différentes.

LimiteCe qu'elle plafonneQuand la modifier
max_tokensLa longueur de la réponse (sortie uniquement)Augmentez-la si la sortie est tronquée
Fenêtre de contexteBudget total pour l'entrée + la sortieDe grosses entrées laissent moins de place à la sortie
Watch out
  • Réglez max_tokens sur ce dont la tâche a besoin. Trop bas tronque la réponse. Inutilement haut ne coûte pas plus cher — vous ne payez que pour les tokens réellement générés — mais cela peut laisser les réponses partir dans tous les sens.

3. Estimer le coût

Vous êtes facturé pour les tokens en entrée + tokens en sortie, aux tarifs par modèle (Opus > Sonnet > Haiku). Une estimation rapide :

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

Obtenez les tarifs actuels sur la page officielle de tarification — nous ne les codons pas en dur ici, volontairement.

Réduire le coût (sans perdre en qualité)

Guided walkthrough1 of 4
  1. Commencez avec Sonnet ; réservez Opus pour les parties difficiles. Voir Choisir un modèle (/docs/api/choosing-a-model).

Plus de stratégie dans Compromis coût & latence.

Vérifiez vos acquis

0/4
  1. Vous planifiez une requête et voulez connaître son décompte de tokens avant l'envoi. Que devez-vous utiliser ?
  2. Votre réponse est sans cesse tronquée en milieu de phrase. Quel réglage modifiez-vous ?
  3. Comment êtes-vous facturé sur l'API ?
  4. Quel est le meilleur premier geste pour réduire le coût sans perdre en qualité ?
Key takeaways
  • Tout se mesure en tokens (~¾ d'un mot) ; ~750 mots ≈ ~1 000 tokens.
  • Comptez les tokens avec l'outillage d'Anthropic — jamais le tokeniseur d'un autre modèle.
  • max_tokens plafonne la réponse ; la fenêtre de contexte est le budget total entrée + sortie.
  • Facturation = tokens en entrée + tokens en sortie aux tarifs par modèle (Opus > Sonnet > Haiku).
  • Réduisez le coût en dimensionnant bien le modèle, en mettant en cache les préfixes, en élaguant les entrées et en regroupant en lots.

Suite