Aller au contenu principal

Claude Opus 5 : Le Guide de Terrain

Intermédiaire

Le 24 juillet 2026, Anthropic a publié Claude Opus 5 (claude-opus-5) — le quatrième modèle en deux mois, après Sonnet 5 (30 juin) et Fable 5 / Mythos 5 (9 juin). Le titre est volontairement ennuyeux : tarif identique à Opus 4.8 de $5 en entrée / $25 en sortie par MTok, même contexte de 1M, même plafond de sortie à 128k. La partie intéressante, c'est ce que ces chiffres inchangés vous achètent désormais : 44,4 % sur Frontier-Bench v0.1 contre 18,7 % pour Opus 4.8 (plus du double), 96,0 % sur SWE-bench Verified, et 30,16 % sur ARC-AGI-3 — soit environ trois fois les 7,78 % de GPT-5.6 Sol et vingt fois les 1,52 % d'Opus 4.8. Opus 5 est désormais le modèle par défaut pour Claude Max et le plus puissant disponible sur Claude Pro.

Cette page est le guide de terrain pratique : ce que ces chiffres signifient vraiment pour votre stack, les deux changements du contrat d'API qui provoqueront une erreur 400 sur une migration naïve, quand Opus 5 remplace légitimement Fable 5 (et quand ce n'est pas le cas), et le nouveau palier d'effort xhigh / max.

What you'll learn
  • Savoir ce qu'est Opus 5 : contexte 1M, sortie 128k, $5 en entrée / $25 en sortie par MTok — même forme qu'Opus 4.8, chiffres nettement meilleurs
  • Comprendre les deux contraintes d'API qui cassent les migrations naïves : restrictions de désactivation du thinking aux paliers d'effort élevés, et thinking activé par défaut qui grignote votre budget max_tokens
  • Lire les benchmarks comme les responsables d'équipes agent les lisent — Frontier-Bench, ARC-AGI-3, SWE-bench Pro, OSWorld 2.0 — et savoir lesquels comptent pour votre charge de travail
  • Faire le calcul de coût honnête : quand Opus 5 en effort max bat Fable 5 sur le coût par tâche résolue, et quand ce n'est pas le cas
  • Choisir le bon palier d'effort — les nouveaux paliers xhigh et max méritent leur place sur Frontier-Bench et ARC-AGI-3, gaspillent des tokens ailleurs
  • Planifier la dépréciation Opus 4.1 → Opus 5 avant la date de retrait du 5 août 2026

La version en un paragraphe

Opus 5 est une augmentation de capacité à tarif neutre, pas un changement de prix. Même $5 / $25 par MTok qu'Opus 4.8, même contexte de 1M tokens, même sortie max de 128k sur l'API Messages synchrone, même date de connaissance fiable décalée à mai 2026. Ce qui a changé, c'est ce que font ces tokens : sur Frontier-Bench v0.1 (l'éval agent-coding la plus difficile d'Anthropic) Opus 5 marque 44,4 % en effort xhigh contre 18,7 % pour Opus 4.8 — plus du double au même prix catalogue. Sur ARC-AGI-3, la résolution de problèmes inédits passe de 1,52 % à 30,16 %. Deux changements de contrat casseront les migrations naïves : le thinking adaptatif est activé par défaut et partage votre budget max_tokens avec la réponse, et thinking: {"type": "disabled"} renvoie maintenant 400 aux nouveaux paliers d'effort xhigh ou max. Opus 5 est le nouveau modèle par défaut sur Claude Max, le plus puissant disponible sur Claude Pro, et accessible via la Claude API, Bedrock (anthropic.claude-opus-5), Google Cloud (claude-opus-5), Microsoft Foundry, et Claude Platform sur AWS.

Ce qui a réellement changé par rapport à Opus 4.8

Opus 4.8 est sorti en avril 2026 comme premier Opus avec une fenêtre de contexte de 1M et thinking adaptatif activé par défaut. Opus 5 conserve chacun de ces defaults, donc sur le fil la forme requête/réponse est presque identique. Quatre choses ont bougé :

  • Les chiffres. Frontier-Bench v0.1 est passé de 18,7 % à 44,4 % (xhigh) / 43,3 % (max). SWE-bench Multimodal de 38,4 % à 59,4 %. OSWorld 2.0 de 55,7 % à 70,57 %. Zapier AutomationBench de 17,0 % à 26,0 %. ARC-AGI-3 de 1,52 % à 30,16 % en effort élevé.
  • Un nouveau palier d'effort max s'insère au-dessus de xhigh, et thinking: {"type": "disabled"} ne fonctionne plus en xhigh ou max (erreur 400). L'intention est qu'à ces paliers vous payez explicitement pour du raisonnement, donc le désactiver silencieusement est désormais un bug plutôt qu'une préférence.
  • L'auto-vérification est désormais le comportement par défaut, pas une habitude induite par prompt. Le guide de migration d'Anthropic vous avertit explicitement de retirer les instructions manuelles « vérifie ton travail » — sinon vous obtenez une double vérification et des tokens gaspillés. C'est la surprise la plus courante lors du premier jour d'exécution de code Opus 5 qui tournait auparavant sur Opus 4.8.
  • Le prompt caching n'invalide plus lors de changements d'outils en cours de conversation (bêta). Si votre boucle agent échange sa liste d'outils à chaque étape, le préfixe de cache survit désormais ; sur Opus 4.8 vous payiez une nouvelle écriture à chaque fois.

Les deux erreurs 400 qui casseront la migration

Guided walkthrough1 of 4
  1. Opus 4.8 permettait de désactiver le thinking à n'importe quel niveau d'effort. Opus 5 n'autorise thinking: {"type": "disabled"} qu'en effort high ou en dessous. L'associer à xhigh ou max est une erreur dure. Si vous avez un wrapper qui désactive toujours le thinking (certaines équipes le font pour garder des réponses concises), soit descendez l'effort à high, soit supprimez le champ thinking et laissez le thinking adaptatif tourner.

Migration minimale sûre — Opus 4.8 vers Opus 5

# Before (Opus 4.8) — worked
response = client.messages.create(
  model="claude-opus-4-8",
  max_tokens=4096,
  extra_body={"effort": "max"},
  thinking={"type": "disabled"},           # allowed on 4.8 at any effort
  system="After answering, verify your work step by step.",
  messages=[...],
)

# After (Opus 5) — three edits
response = client.messages.create(
  model="claude-opus-5",
  max_tokens=16384,                        # thinking now shares this budget
  extra_body={"effort": "max"},
  # thinking={"type": "disabled"}          # 400 at xhigh/max — remove it
  system="Answer the question.",           # drop the verify instruction — Opus 5 self-verifies
  messages=[...],
)

Les benchmarks qui comptent vraiment

Anthropic a publié beaucoup de chiffres le jour du lancement. Trois sont porteurs pour de vraies charges de travail, un est un trophée marketing, et deux méritent d'être lus attentivement car ils montrent où Opus 5 n'est pas le meilleur choix.

  • Frontier-Bench v0.1 — 44,4 % (xhigh) contre 18,7 % pour Opus 4.8. C'est l'éval d'agentic-coding la plus difficile d'Anthropic — tâches à long horizon qui exigent que le modèle exécute des outils, itère et s'auto-corrige. Le saut de 2,4× au même prix est la raison la plus forte de migrer.
  • SWE-bench Verified — 96,0 %. Proche du plafond. Si vous utilisiez Opus 4.8 ou Fable 5 pour des corrections de bug de style SWE-bench, Opus 5 est une mise à niveau directe. Mais SWE-bench Verified est maintenant un benchmark saturé — les petites différences ne distinguent plus les modèles comme avant.
  • OSWorld 2.0 — 70,57 % contre 55,7 % pour Opus 4.8. Benchmark d'utilisation d'ordinateur. Si vous exécutez Claude for Chrome, le mode navigateur de Claude Cowork, ou tout autre outil qui clique dans une vraie UI, c'est le chiffre à surveiller.
  • ARC-AGI-3 — 30,16 % (effort élevé) contre 7,78 % pour GPT-5.6 Sol et 1,52 % pour Opus 4.8. Le trophée marketing. ARC-AGI-3 teste la résolution de problèmes inédits qui résistent à la mémorisation, et Opus 5 est environ 3× le meilleur modèle suivant. Signal significatif si votre charge de travail a une vraie nouveauté ; moins pertinent s'il s'agit de variantes de choses qu'Internet a déjà résolues.
  • SWE-bench Pro — 79,2 % contre 80,0 % pour Fable 5. Fable 5 devance encore Opus 5 de 0,8 pp sur le SWE-bench Pro plus difficile. Pas assez pour justifier le prix 2× de Fable 5 pour la plupart des équipes, mais si vous êtes dans le décile supérieur de complexité de code et que chaque point compte, notez-le.
  • Exploitation cybersécurité — Opus 5 se situe derrière Mythos 5. Anthropic dit explicitement qu'Opus 5 n'est pas le meilleur modèle cyber. Si vous faites du travail cyber défensif via Project Glasswing, Mythos reste le choix.

Quand Opus 5 remplace Fable 5 (et quand ce n'est pas le cas)

La question intéressante que ce lancement impose : quand avez-vous vraiment besoin du tarif à $10 / $50 de Fable 5 ? L'affirmation d'Anthropic est qu'Opus 5 atteint à 0,5 % près le pic de Fable 5 sur CursorBench 3.2 à la moitié du coût, et égale le résultat OSWorld 2.0 de Fable 5 à « juste un peu plus du tiers du coût ». C'est la version forte de l'argument. La version honnête :

  • Choisissez Opus 5 pour l'agentic coding, l'utilisation d'ordinateur, l'automatisation métier, le raisonnement en sciences du vivant, et tout ce où le coût par tâche résolue compte plus que les derniers 1-3 pp de qualité. C'est plus de 90 % des charges de production.
  • Choisissez Fable 5 quand la charge est (a) des agents à longue durée où le run marginal bénéficie vraiment du dernier pourcent (Anthropic présente Fable 5 comme « intelligence de nouvelle génération pour agents à longue durée »), (b) des tâches de code dures de style SWE-bench Pro où vous avez mesuré un vrai écart, ou (c) toute charge où vous êtes déjà dans la courbe précision-vs-coût où 2× coût achète de la vraie qualité.
  • Choisissez Mythos 5 pour du cyber défensif sur invitation via Project Glasswing.

Honest cost-per-solved-task math

# Fable 5 on a hard agentic task
#   ~500k input tokens, ~50k output tokens
#   500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run
#   Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $7.50 / 0.46 = ~$16.30

# Opus 5 on the same task
#   Same token budget
#   500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run
#   Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $3.75 / 0.444 = ~$8.45

# Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality.
# Break-even: Fable 5 would need to be 2x cheaper per successful run,
# i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.

Le nouveau palier d'effort max — quand il mérite sa place

Opus 5 introduit max comme palier explicite au-dessus de xhigh. Le thinking adaptatif s'étend désormais de low → medium → high → xhigh → max, et high est le défaut sur la Claude API et Claude Code. Deux observations tirées des benchmarks de lancement :

  • Sur Frontier-Bench v0.1, xhigh marque en réalité 44,4 % contre 43,3 % pour max — max n'est pas strictement meilleur. Il brûle plus de tokens par tentative mais le raisonnement supplémentaire ne se convertit pas toujours sur cette éval.
  • Sur les tâches qui récompensent la longue délibération — ARC-AGI-3, problèmes de recherche inédits, raisonnement mathématique difficile (niveau médaille d'or IMO 2026, 42/42) — les paliers supérieurs méritent leur place.

La règle pratique : par défaut high, passez à xhigh quand votre éval montre des gains mesurables, n'utilisez max que pour les charges où vous avez vérifié que la profondeur de raisonnement compte plus que le débit. Ne réglez pas max en espérant ; mesurez.

Sciences du vivant, sécurité et posture cyber

Trois chiffres à épingler :

  • Sciences du vivant. Opus 5 est à +10,2 points de pourcentage au-dessus d'Opus 4.8 en chimie organique et +7,7 pp en prédiction de protéines. Si vous construisez des agents pour la biologie structurale, la bioinformatique ou la planification de synthèse, c'est un vrai saut — pas une amélioration dans le bruit.
  • Résistance à l'injection de prompt. Sur le benchmark Gray Swan, le taux de succès attaquant tombe de 5,5 % (Opus 4.8) à 2,0 %. Dans les environnements navigateur Claude Cowork, les garde-fous du mode auto amènent le succès des injections de prompt navigateur à 0 % dans les mesures d'Anthropic. Significatif pour quiconque expédie des agents de style Claude-for-Chrome.
  • Classificateurs cyber. Les garde-fous cyber d'Opus 5 interviennent ~85 % moins souvent que pour Fable 5 — parce qu'Opus 5 n'est délibérément pas le meilleur modèle cyber, le taux d'intervention est atténué. Si vous voyiez des refus de sécurité fallacieux sur des prompts légitimes de recherche en sécurité sur Fable 5, Opus 5 vous semblera nettement moins prompt à s'alarmer.

Calendrier de dépréciation à planifier

  • Opus 4.1 (claude-opus-4-1-20250805) est retiré le 5 août 2026 — onze jours après le lancement d'Opus 5. Si une surface de production épingle encore Opus 4.1, migrez cette semaine.
  • Opus 4.5 / 4.6 / 4.7 / 4.8 restent disponibles comme « Modèles Legacy » dans l'aperçu de la plateforme, mais attendez-vous à des cycles de dépréciation standard de 12 mois. Traitez Opus 5 comme la cible de migration pour tout ce qui est nouveau.
  • L'ID de modèle d'Opus 5 est un snapshot épinglé, pas un pointeur evergreen. Depuis la génération 4.6, le format d'ID sans date signifie toujours « snapshot fixe ». Un futur claude-opus-5-1 serait un nouvel ID, pas une mise à niveau silencieuse de claude-opus-5.

Essayez-le — une commande

Run Opus 5 with the recommended defaults

# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()

response = client.messages.create(
  model="claude-opus-5",
  max_tokens=8192,                    # room for adaptive thinking + response
  extra_body={"effort": "high"},      # default; move to xhigh only if evals justify
  system="You are a senior engineer. Answer directly and iterate until the task is complete.",
  messages=[{"role": "user", "content": "..."}],
)

# Claude Code
claude --model claude-opus-5

# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast"  # separate model ID, $10/$50 per MTok

Antisèche

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 8

Vérifiez votre compréhension

Check yourself

0/5
  1. Vous migrez un wrapper qui épinglait `model="claude-opus-4-8"`, `effort: "max"`, et `thinking: {"type": "disabled"}` vers Opus 5. Que se passe-t-il ?
  2. Votre prompt Opus 4.8 se termine par « Maintenant vérifie ta réponse étape par étape. » Vous passez à Opus 5 et voyez environ le double du coût en tokens de thinking sur les prompts difficiles. Pourquoi ?
  3. Pour une charge de production d'agentic coding où le taux de résolution compte et où le coût est une vraie contrainte, quel modèle les données de lancement d'Opus 5 soutiennent-elles le plus fortement ?
  4. Vous réglez `effort: "max"` à chaque requête en attendant une qualité strictement meilleure que `xhigh`. Que suggèrent les données de lancement d'Anthropic ?
  5. Laquelle de ces dates de dépréciation devez-vous planifier après le lancement d'Opus 5 ?

Pour aller plus loin

Sources & lectures complémentaires