Aller au contenu principal

Tokens, contexte et mémoire

Débutant

Trois idées débloquent beaucoup de moments « pourquoi a-t-il fait ça ? » : les tokens, la fenêtre de contexte et la mémoire. Une fois ces notions acquises, vous cesserez d'être surpris par la dérive, les oublis et les factures inattendues.

What you'll learn
  • Lire le texte comme le fait un modèle — en tokens, pas en mots ni en caractères
  • Vous représenter la fenêtre de contexte comme un bureau fini, et prédire quand les choses en tombent
  • Reconnaître la « pourriture du contexte » — pourquoi les modèles peuvent perdre le milieu d'une longue entrée
  • Connaître les quatre vraies sources de « mémoire » et comment la fournir intentionnellement

Les tokens : l'unité dans laquelle les modèles pensent

Les modèles ne lisent ni les caractères ni les mots — ils lisent des tokens, des fragments de texte représentant environ ¾ d'un mot en anglais. « Unbelievable » peut faire 3 à 4 tokens ; les mots courants comptent pour un chacun ; une espace, une virgule ou un morceau de code coûtent eux aussi des tokens. Votre entrée et la sortie du modèle sont toutes deux comptées, et les tokens sont précisément l'unité dans laquelle se mesurent les prix et les limites.

Vous n'avez pas besoin de compter à la main, mais un ordre de grandeur aide : ~750 mots ≈ ~1 000 tokens. Tapez quelque chose et observez :

12mots
80caractères
~1620tokens estimés

Une estimation approximative seulement (~caractères ÷ 4, ou mots × 1.33). Le nombre de tokens dépend du modèle — n'utilisez jamais le tokenizer d'un autre modèle. Pour des chiffres exacts, utilisez l'endpoint de comptage de tokens d'Anthropic.

:::tip Pourquoi le ratio varie L'anglais courant tourne autour de ¾ de mot par token. Le code, le JSON, les écritures non latines, les longues URL et les mots rares se découpent en davantage de tokens — un fichier de 500 lignes ou un paragraphe en chinois coûte donc plus que ne le suggère son nombre de mots. Quand une facture ou une limite vous surprend, c'est généralement la raison. :::

La fenêtre de contexte : la mémoire de travail

La fenêtre de contexte est le nombre maximal de tokens que le modèle peut considérer en une seule fois — votre prompt système, toute la conversation jusqu'ici, les fichiers attachés et la réponse en cours de rédaction, le tout ensemble. Voyez-la comme le bureau du modèle : grand, mais fini. La taille de la fenêtre varie selon le modèle et ne cesse de croître — consultez Modèles et tarifs pour les chiffres actuels plutôt que d'en mémoriser un.

Tout ce que le modèle « sait » sur le moment se trouve sur ce bureau :

Quand une conversation dépasse la fenêtre, le contenu le plus ancien tombe. C'est pourquoi une conversation très longue peut sembler « oublier » comment elle a commencé, ou s'éloigner de votre instruction initiale.

La pourriture du contexte : ce n'est pas seulement plein contre vide

Un problème plus subtil : même quand tout tient encore, les modèles ont tendance à exploiter le début et la fin d'une longue entrée plus fidèlement que le milieu. Enfouissez la seule phrase qui compte au centre d'un copier-coller de 50 pages et elle risque d'être sous-pondérée — un mode de défaillance souvent appelé « perdu au milieu ».

Guided walkthrough1 of 4
  1. Mettez l'instruction ou la question réelle en premier, avant de coller un long document — pas enfouie après.

Voici la même requête, structurée pour que l'instruction occupe les positions fortes :

Instruction d'abord, reformulée à la fin

Tâche : trouver chaque endroit où ce contrat plafonne notre responsabilité, et citer la clause exacte.

[... collez ici le contrat complet de 40 pages ...]

Rappel de la tâche : lister uniquement les clauses de plafonnement de responsabilité, avec les citations exactes et les numéros de section. Ignorer tout le reste.

:::tip Dans Claude Code Les longues sessions d'agent atteignent le même plafond. Claude Code le gère délibérément — en compactant l'historique et en vous laissant piloter ce qui reste sous les yeux. Voir Gestion du contexte et Ingénierie du contexte. :::

La mémoire : il n'y en a aucune, sauf si vous la fournissez

Par défaut, chaque conversation est une page blanche. Le modèle ne se souvient pas de votre dernière conversation. Tout ce qui ressemble à de la mémoire est l'une de ces quatre choses :

SourceCe que c'estVous la contrôlez en
Historique renvoyéLes applications de chat renvoient la conversation à chaque tour, jusqu'à ce que la fenêtre se remplisseDémarrant de nouvelles conversations ; gardant les fils centrés
Fonctions de mémoireCertaines surfaces Claude conservent des faits d'une conversation à l'autreRéglages Mémoire entre conversations
Fichiers que vous fournissezDu contexte persistant que vous attachez intentionnellementProjects, CLAUDE.md
Votre propre codeL'API est sans état — vous renvoyez les messages précédentsPremier appel API

Le fil conducteur : si vous voulez que le modèle se souvienne de quelque chose, vous devez continuer à le poser sur le bureau.

Pourquoi c'est important

Presque tout problème du type « il a ignoré mon instruction précédente » ou « il a perdu le fil » remonte à l'une de ces trois causes : la fenêtre s'est remplie, une nouvelle session a démarré à froid, ou le détail clé était au milieu mort d'un long copier-coller. Sachant cela, vous structurerez vos prompts et vos sessions pour garder l'essentiel sous les yeux.

Vérifiez vos acquis

Check yourself

0/3
  1. Environ combien de tokens représentent 750 mots d'anglais courant ?
  2. Une longue conversation se met à « oublier » comment elle a commencé. La cause la plus probable est :
  3. Vous devez coller un énorme document plus une instruction clé. Meilleur placement ?

Termes clés

Ancrez le vocabulaire
Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 4

:::note À retenir

  • Les tokens sont l'unité à la fois de la pensée et de la facturation — ~1 000 pour 750 mots anglais, davantage pour le code et d'autres écritures.
  • La fenêtre de contexte est un bureau fini ; les longues conversations oublient parce que l'ancien contenu en tombe.
  • Même à l'intérieur de la fenêtre, commencez par votre instruction et reformulez-la à la fin — le milieu est sous-exploité.
  • Il n'y a aucune mémoire par défaut. Fournissez-la délibérément avec des fichiers, des Projects, CLAUDE.md, ou en renvoyant l'historique. :::

Suite