Aller au contenu principal

Réflexion étendue et effort

Intermédiaire

Pour les problèmes difficiles, Claude peut consacrer davantage de calcul à réfléchir avant de répondre — améliorant la précision sur le raisonnement en plusieurs étapes, le code délicat et les mathématiques. Vous contrôlez à peu près combien d'effort dépenser. Cette leçon vous apprend à adapter la profondeur à la tâche, à activer la réflexion via l'API et à la budgéter sans payer trop cher.

What you'll learn
  • Expliquer le compromis : moins de réflexion est plus rapide et moins cher, plus de réflexion est meilleure sur les problèmes difficiles
  • Choisir le bon palier d'effort (Faible / Moyen / Élevé) pour une charge de travail donnée
  • Activer la réflexion étendue sur la Messages API et relire les blocs de réflexion et de texte
  • Budgéter correctement les tokens de réflexion pour que budget_tokens reste inférieur à max_tokens
  • Appliquer l'effort judicieusement dans les agents et en complément du prompting en chaîne de pensée

L'idée unique derrière l'effort

La réflexion est un cadran, pas un interrupteur. Imaginez les deux extrêmes :

  • Moins de réflexion = plus rapide, moins cher — parfait pour des tâches simples et bien spécifiées.
  • Plus de réflexion = meilleure sur les problèmes réellement difficiles, au prix d'une latence/d'un coût plus élevés.

Voici le piège qui déroute les gens : une réflexion supplémentaire ne fait rien pour une tâche qui était déjà facile. Vous ne payez que la latence et le coût. La compétence consiste à dépenser de la profondeur là où elle change la réponse.

Les modèles plus récents exposent cela comme un contrôle d'effort (et adaptent automatiquement la profondeur de réflexion) ; sur ceux-ci, vous choisissez un palier plutôt qu'un budget brut de tokens. Adaptez le palier à la tâche.

Étape 1 — Choisir votre profondeur

Avant de toucher au moindre code, demandez-vous : à quel point cette tâche est-elle vraiment difficile ? Mappez-la à un palier.

TâcheEffort suggéré
Formatage, extraction, questions-réponses simplesFaible
Codage courant, rédaction, analyseMoyen
Débogage difficile, algorithmes délicats, démonstrations rigoureusesÉlevé
Pro tip
  • Ne mettez pas tout par défaut au maximum — vous payez en latence et en coût pour une réflexion dont la tâche n'a pas besoin.
  • Commencez à moyen ; ne montez que là où la qualité l'exige.

Essayez vous-même : avant de poursuivre, classez ces trois cas — (a) « extraire l'e-mail de ce texte », (b) « refactoriser cette fonction », (c) « démontrer cette inégalité ». Quel palier convient à chacun ? Vérifiez vos réponses avec le tableau ci-dessus.

Étape 2 — L'activer (API)

Sur la Messages API, activez la réflexion avec un bloc thinking et un budget de tokens. Suivez ces étapes.

Guided walkthrough1 of 3
  1. Passez thinking={"type": "enabled", "budget_tokens": N} sur messages.create pour activer le raisonnement étendu.

Maintenant, câblez le tout. Copiez ceci, exécutez-le et regardez la réponse arriver en deux blocs — le raisonnement d'abord, puis la réponse.

Activer la réflexion étendue (Python)

import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
  model="claude-sonnet-5",
  max_tokens=16000,
  thinking={"type": "enabled", "budget_tokens": 10000},
  messages=[{"role": "user", "content": "Prove that 2^n > n^2 for all n >= 5."}],
)

for block in message.content:
  if block.type == "thinking":
      print("REASONING:", block.thinking)
  elif block.type == "text":
      print("ANSWER:", block.text)

Un budget plus grand offre plus de marge pour raisonner, sans garantie que Claude l'utilise entièrement — la profondeur s'adapte au problème. Réglez le budget comme un plafond, puis réduisez-le si la latence gêne. Les identifiants de modèle proviennent du tableau des modèles ; la forme exacte du paramètre peut différer sur les modèles plus récents, alors vérifiez avec la source liée ci-dessus.

Étape 3 — Bien l'utiliser en pratique

Trois habitudes distinguent ceux qui activent la réflexion de ceux qui la maîtrisent :

  • La réflexion étendue se marie bien avec le prompting en chaîne de pensée — mais sur les modèles de raisonnement, vous n'avez souvent pas besoin de demander un pas-à-pas ; la réflexion se produit en interne.
  • La réflexion consomme des tokens, ce qui influe sur le coût — budgétez en conséquence.
  • Pour les agents, plus d'effort sur l'étape de planification et moins sur les appels d'outils de routine est une bonne répartition.
Key takeaways
  • L'effort/la réflexion échange latence et coût contre précision sur les problèmes difficiles — il ne fait rien pour les tâches déjà simples.
  • Paliers : Faible pour formatage/extraction/questions-réponses simples, Moyen pour codage courant/rédaction/analyse, Élevé pour débogage difficile/algorithmes/démonstrations.
  • Sur la Messages API, budget_tokens provient du même pool de sortie, donc il doit être inférieur à max_tokens ; la réponse est un bloc de réflexion puis un bloc de texte.
  • Traitez le budget comme un plafond, pas une cible — Claude n'utilise que ce dont le problème a besoin.
  • Dans les agents, dépensez l'effort sur la planification et conservez-le sur les appels d'outils de routine.

Ancrez-le

Rappel rapide avant de partir — retournez chaque carte et répondez à voix haute.

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 5

Vérifiez vos acquis

0/5
  1. Quel est le compromis fondamental à dépenser plus d'effort de réflexion ?
  2. Quel palier d'effort convient au codage courant, à la rédaction et à l'analyse ?
  3. Sur la Messages API, que doit-il être vrai de budget_tokens ?
  4. Comment revient la réponse lorsque la réflexion étendue est activée ?
  5. Pour les agents, comment répartir l'effort ?

Suite