Contrôles d'échantillonnage : température et compagnie
- Ce que font vraiment la température, top-p, top-k et les séquences d'arrêt au choix du token suivant
- Une table de décision d'un coup d'œil pour savoir quand tourner à froid ou à chaud
- Pourquoi mettre temperature=0 ne garantit PAS des sorties identiques
- Comment raisonner sur l'échantillonnage sur les nouveaux modèles Claude qui cachent les boutons
Quand un modèle génère du texte, il pioche le token suivant dans une distribution de probabilités. Les contrôles d'échantillonnage règlent comment il pioche — à quel point la sortie est concentrée ou variée.
Les principaux boutons
- Redimensionne toute la distribution. Basse (≈0) = concentrée, quasi-déterministe, reproductible ; le modèle prend le chemin le plus probable. Haute = plus variée et créative, mais plus encline à la dérive ou à l'erreur.
- Restreint les choix au plus petit ensemble de tokens dont les probabilités somment à p. Une autre manière de borner l'aléa — elle s'adapte au pic de la distribution.
- Ne considère que les k tokens les plus probables. Plus brutal que top-p ; parfois utile pour des sorties très courtes et contraintes.
- Chaînes qui, lorsqu'elles sont générées, terminent immédiatement la réponse. Pratique pour la sortie structurée où vous voulez que le modèle s'arrête après un délimiteur.
- Ajustez température OU top-p, pas les deux — ils interagissent et le comportement combiné est difficile à raisonner.
- Laissez top-k tranquille par défaut. C'est un marteau lourd qui gêne le plus souvent.
- Les séquences d'arrêt sont une bonne ceinture de sécurité pour la sortie structurée — plus de prose parasite après votre JSON.
Quand tourner à froid ou à chaud
| Tourner à froid (temp basse) | Tourner à chaud (temp plus haute) |
|---|---|
| Extraction, classification, code | Brainstorming, noms, copie créative |
| Tout ce qu'on veut reproductible | Explorer de multiples options |
| Sortie factuelle / structurée | Variété de ton, idéation |
| Notation / LLM-comme-juge | Idéation pour copie A/B |
Un bon défaut pour la plupart des travaux est modéré à bas (environ 0–0,4). Poussez-la seulement quand vous voulez la surprise.
Un exemple pratique
Même prompt, trois températures. Modèle illustratif, pas un benchmark :
Prompt
Give me one clever name for a productivity app that helps writers.
- temp 0 → un choix sûr et reproductible comme
WordFlow. Redemandez, obtenezWordFlowencore. - temp 0.5 → toujours cohérent, plus de variété d'un lancement à l'autre :
Draftly,Inkline,Composera. - temp 1.0 → créatif mais plus bruité :
Quillspark,Verbatimo, occasionnellement un mot bancal qui ne sonne pas.
La leçon : ne poussez la température que là où la variété est le but de la tâche.
Les nouveaux modèles Claude les cachent
Plusieurs modèles Claude récents adaptent leur propre décodage et atténuent (ou omettent) la température. Si un bouton n'est pas disponible, c'est par conception — façonnez le comportement via le prompt et (là où c'est offert) le réglage effort/thinking. La clarté du prompt et le cadrage du rôle font plus de travail que les boutons d'échantillonnage sur les modèles modernes.
Réserve sur le déterminisme
Même à température 0, les sorties ne sont pas garanties bit-identiques entre les lancements, les versions de modèle ou les fournisseurs. Raisons :
- Batching et non-déterminisme flottant côté serveur.
- Mises à jour silencieuses derrière un alias.
- Légères différences d'entrée (un espace parasite, un tokenizer différent).
Ne comptez pas sur la reproductibilité exacte. Comptez sur les evals pour détecter la dérive quand ça compte.
Erreurs courantes
- Pousser la température pour corriger une mauvaise sortie — le correctif est presque toujours dans le prompt, pas dans l'échantillonneur.
- Mélanger top-p et température — choisissez un bouton et gardez l'autre par défaut pour pouvoir raisonner sur les changements.
- Supposer que temp=0 signifie déterministe — non. Utilisez les evals, pas des vérifications d'égalité, pour détecter les régressions.
- Utiliser des séquences d'arrêt sur de la prose — parfait pour des délimiteurs JSON, gênant pour du texte libre où le modèle peut légitimement produire la chaîne.
Vérifiez-vous
Vérifiez-vous
0/4- La température est le bouton principal ; top-p est une alternative ; top-k et les séquences d'arrêt sont situationnels.
- À froid pour l'extraction, le code et la notation ; à chaud pour le brainstorming et la copie créative.
- Ajustez un bouton d'aléa à la fois — température OU top-p.
- Temp 0 ≠ déterministe. Comptez sur les evals, pas sur l'égalité, pour attraper la dérive de comportement.
- Sur les nouveaux modèles Claude, prompt + effort/thinking remplacent les boutons d'échantillonnage.