Aller au contenu principal

Contrôles d'échantillonnage : température et compagnie

Intermédiaire
What you'll learn
  • Ce que font vraiment la température, top-p, top-k et les séquences d'arrêt au choix du token suivant
  • Une table de décision d'un coup d'œil pour savoir quand tourner à froid ou à chaud
  • Pourquoi mettre temperature=0 ne garantit PAS des sorties identiques
  • Comment raisonner sur l'échantillonnage sur les nouveaux modèles Claude qui cachent les boutons

Quand un modèle génère du texte, il pioche le token suivant dans une distribution de probabilités. Les contrôles d'échantillonnage règlent comment il pioche — à quel point la sortie est concentrée ou variée.

Les principaux boutons

Guided walkthrough1 of 4
  1. Redimensionne toute la distribution. Basse (≈0) = concentrée, quasi-déterministe, reproductible ; le modèle prend le chemin le plus probable. Haute = plus variée et créative, mais plus encline à la dérive ou à l'erreur.
Pro tip
  • Ajustez température OU top-p, pas les deux — ils interagissent et le comportement combiné est difficile à raisonner.
  • Laissez top-k tranquille par défaut. C'est un marteau lourd qui gêne le plus souvent.
  • Les séquences d'arrêt sont une bonne ceinture de sécurité pour la sortie structurée — plus de prose parasite après votre JSON.

Quand tourner à froid ou à chaud

Tourner à froid (temp basse)Tourner à chaud (temp plus haute)
Extraction, classification, codeBrainstorming, noms, copie créative
Tout ce qu'on veut reproductibleExplorer de multiples options
Sortie factuelle / structuréeVariété de ton, idéation
Notation / LLM-comme-jugeIdéation pour copie A/B

Un bon défaut pour la plupart des travaux est modéré à bas (environ 0–0,4). Poussez-la seulement quand vous voulez la surprise.

Un exemple pratique

Même prompt, trois températures. Modèle illustratif, pas un benchmark :

Prompt

Give me one clever name for a productivity app that helps writers.
  • temp 0 → un choix sûr et reproductible comme WordFlow. Redemandez, obtenez WordFlow encore.
  • temp 0.5 → toujours cohérent, plus de variété d'un lancement à l'autre : Draftly, Inkline, Composera.
  • temp 1.0 → créatif mais plus bruité : Quillspark, Verbatimo, occasionnellement un mot bancal qui ne sonne pas.

La leçon : ne poussez la température que là où la variété est le but de la tâche.

Les nouveaux modèles Claude les cachent

Plusieurs modèles Claude récents adaptent leur propre décodage et atténuent (ou omettent) la température. Si un bouton n'est pas disponible, c'est par conception — façonnez le comportement via le prompt et (là où c'est offert) le réglage effort/thinking. La clarté du prompt et le cadrage du rôle font plus de travail que les boutons d'échantillonnage sur les modèles modernes.

Réserve sur le déterminisme

Même à température 0, les sorties ne sont pas garanties bit-identiques entre les lancements, les versions de modèle ou les fournisseurs. Raisons :

  • Batching et non-déterminisme flottant côté serveur.
  • Mises à jour silencieuses derrière un alias.
  • Légères différences d'entrée (un espace parasite, un tokenizer différent).

Ne comptez pas sur la reproductibilité exacte. Comptez sur les evals pour détecter la dérive quand ça compte.

Erreurs courantes

Pro tip
  • Pousser la température pour corriger une mauvaise sortie — le correctif est presque toujours dans le prompt, pas dans l'échantillonneur.
  • Mélanger top-p et température — choisissez un bouton et gardez l'autre par défaut pour pouvoir raisonner sur les changements.
  • Supposer que temp=0 signifie déterministe — non. Utilisez les evals, pas des vérifications d'égalité, pour détecter les régressions.
  • Utiliser des séquences d'arrêt sur de la prose — parfait pour des délimiteurs JSON, gênant pour du texte libre où le modèle peut légitimement produire la chaîne.

Vérifiez-vous

Vérifiez-vous

0/4
  1. Vous devez extraire des champs d'une facture de façon fiable. Quel réglage de température ?
  2. Quel couple de boutons ne devriez-vous généralement PAS régler ensemble ?
  3. Vous mettez temperature=0 et obtenez des sorties légèrement différentes sur deux lancements. Quelle est la cause la plus probable ?
  4. Sur un nouveau modèle Claude où le bouton température n'est pas exposé, comment façonnez-vous le comportement ?
Key takeaways
  • La température est le bouton principal ; top-p est une alternative ; top-k et les séquences d'arrêt sont situationnels.
  • À froid pour l'extraction, le code et la notation ; à chaud pour le brainstorming et la copie créative.
  • Ajustez un bouton d'aléa à la fois — température OU top-p.
  • Temp 0 ≠ déterministe. Comptez sur les evals, pas sur l'égalité, pour attraper la dérive de comportement.
  • Sur les nouveaux modèles Claude, prompt + effort/thinking remplacent les boutons d'échantillonnage.

Suite