Claude Opus 5 : Le Guide de Terrain
Le 24 juillet 2026, Anthropic a publié Claude Opus 5 (claude-opus-5) — le quatrième modèle en deux mois, après Sonnet 5 (30 juin) et Fable 5 / Mythos 5 (9 juin). Le titre est volontairement ennuyeux : tarif identique à Opus 4.8 de $5 en entrée / $25 en sortie par MTok, même contexte de 1M, même plafond de sortie à 128k. La partie intéressante, c'est ce que ces chiffres inchangés vous achètent désormais : 44,4 % sur Frontier-Bench v0.1 contre 18,7 % pour Opus 4.8 (plus du double), 96,0 % sur SWE-bench Verified, et 30,16 % sur ARC-AGI-3 — soit environ trois fois les 7,78 % de GPT-5.6 Sol et vingt fois les 1,52 % d'Opus 4.8. Opus 5 est désormais le modèle par défaut pour Claude Max et le plus puissant disponible sur Claude Pro.
Cette page est le guide de terrain pratique : ce que ces chiffres signifient vraiment pour votre stack, les deux changements du contrat d'API qui provoqueront une erreur 400 sur une migration naïve, quand Opus 5 remplace légitimement Fable 5 (et quand ce n'est pas le cas), et le nouveau palier d'effort xhigh / max.
- Savoir ce qu'est Opus 5 : contexte 1M, sortie 128k, $5 en entrée / $25 en sortie par MTok — même forme qu'Opus 4.8, chiffres nettement meilleurs
- Comprendre les deux contraintes d'API qui cassent les migrations naïves : restrictions de désactivation du thinking aux paliers d'effort élevés, et thinking activé par défaut qui grignote votre budget max_tokens
- Lire les benchmarks comme les responsables d'équipes agent les lisent — Frontier-Bench, ARC-AGI-3, SWE-bench Pro, OSWorld 2.0 — et savoir lesquels comptent pour votre charge de travail
- Faire le calcul de coût honnête : quand Opus 5 en effort max bat Fable 5 sur le coût par tâche résolue, et quand ce n'est pas le cas
- Choisir le bon palier d'effort — les nouveaux paliers xhigh et max méritent leur place sur Frontier-Bench et ARC-AGI-3, gaspillent des tokens ailleurs
- Planifier la dépréciation Opus 4.1 → Opus 5 avant la date de retrait du 5 août 2026
La version en un paragraphe
Opus 5 est une augmentation de capacité à tarif neutre, pas un changement de prix. Même $5 / $25 par MTok qu'Opus 4.8, même contexte de 1M tokens, même sortie max de 128k sur l'API Messages synchrone, même date de connaissance fiable décalée à mai 2026. Ce qui a changé, c'est ce que font ces tokens : sur Frontier-Bench v0.1 (l'éval agent-coding la plus difficile d'Anthropic) Opus 5 marque 44,4 % en effort xhigh contre 18,7 % pour Opus 4.8 — plus du double au même prix catalogue. Sur ARC-AGI-3, la résolution de problèmes inédits passe de 1,52 % à 30,16 %. Deux changements de contrat casseront les migrations naïves : le thinking adaptatif est activé par défaut et partage votre budget max_tokens avec la réponse, et thinking: {"type": "disabled"} renvoie maintenant 400 aux nouveaux paliers d'effort xhigh ou max. Opus 5 est le nouveau modèle par défaut sur Claude Max, le plus puissant disponible sur Claude Pro, et accessible via la Claude API, Bedrock (anthropic.claude-opus-5), Google Cloud (claude-opus-5), Microsoft Foundry, et Claude Platform sur AWS.
Ce qui a réellement changé par rapport à Opus 4.8
Opus 4.8 est sorti en avril 2026 comme premier Opus avec une fenêtre de contexte de 1M et thinking adaptatif activé par défaut. Opus 5 conserve chacun de ces defaults, donc sur le fil la forme requête/réponse est presque identique. Quatre choses ont bougé :
- Les chiffres. Frontier-Bench v0.1 est passé de 18,7 % à 44,4 % (xhigh) / 43,3 % (max). SWE-bench Multimodal de 38,4 % à 59,4 %. OSWorld 2.0 de 55,7 % à 70,57 %. Zapier AutomationBench de 17,0 % à 26,0 %. ARC-AGI-3 de 1,52 % à 30,16 % en effort élevé.
- Un nouveau palier d'effort
maxs'insère au-dessus dexhigh, etthinking: {"type": "disabled"}ne fonctionne plus enxhighoumax(erreur 400). L'intention est qu'à ces paliers vous payez explicitement pour du raisonnement, donc le désactiver silencieusement est désormais un bug plutôt qu'une préférence. - L'auto-vérification est désormais le comportement par défaut, pas une habitude induite par prompt. Le guide de migration d'Anthropic vous avertit explicitement de retirer les instructions manuelles « vérifie ton travail » — sinon vous obtenez une double vérification et des tokens gaspillés. C'est la surprise la plus courante lors du premier jour d'exécution de code Opus 5 qui tournait auparavant sur Opus 4.8.
- Le prompt caching n'invalide plus lors de changements d'outils en cours de conversation (bêta). Si votre boucle agent échange sa liste d'outils à chaque étape, le préfixe de cache survit désormais ; sur Opus 4.8 vous payiez une nouvelle écriture à chaque fois.
Les deux erreurs 400 qui casseront la migration
- Opus 4.8 permettait de désactiver le thinking à n'importe quel niveau d'effort. Opus 5 n'autorise thinking: {"type": "disabled"} qu'en effort high ou en dessous. L'associer à xhigh ou max est une erreur dure. Si vous avez un wrapper qui désactive toujours le thinking (certaines équipes le font pour garder des réponses concises), soit descendez l'effort à high, soit supprimez le champ thinking et laissez le thinking adaptatif tourner.
- Même piège que la migration Sonnet 5. max_tokens est un plafond dur sur la sortie totale — blocs de thinking plus texte de réponse. Si vous avez dimensionné max_tokens pour « juste la réponse » sur Opus 4.8 avec thinking désactivé, et que vous ne le désactivez pas sur Opus 5, vous verrez des réponses tronquées avec stop_reason: 'max_tokens'. Augmentez max_tokens, descendez l'effort à medium, ou désactivez explicitement le thinking en high ou en dessous.
- Hérité d'Opus 4.7 — thinking: {type: 'enabled', budget_tokens: N} renvoie 400. Utilisez effort à la place. Si vous calculiez un budget par requête, remplacez cette logique par un sélecteur d'effort ; le contrôleur adaptatif décide maintenant du temps de réflexion selon la difficulté de la tâche.
- Pas un 400, mais une régression de coût silencieuse. Opus 5 itère et s'auto-vérifie sans qu'on le lui demande. Toute structure « maintenant vérifie ta réponse étape par étape » que vous aviez ajoutée sur 4.6 ou 4.8 déclenchera une seconde passe de vérification et environ doublera les tokens de thinking sur les prompts difficiles. Supprimez ces instructions et relancez votre éval.
Migration minimale sûre — Opus 4.8 vers Opus 5
# Before (Opus 4.8) — worked
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=4096,
extra_body={"effort": "max"},
thinking={"type": "disabled"}, # allowed on 4.8 at any effort
system="After answering, verify your work step by step.",
messages=[...],
)
# After (Opus 5) — three edits
response = client.messages.create(
model="claude-opus-5",
max_tokens=16384, # thinking now shares this budget
extra_body={"effort": "max"},
# thinking={"type": "disabled"} # 400 at xhigh/max — remove it
system="Answer the question.", # drop the verify instruction — Opus 5 self-verifies
messages=[...],
)Les benchmarks qui comptent vraiment
Anthropic a publié beaucoup de chiffres le jour du lancement. Trois sont porteurs pour de vraies charges de travail, un est un trophée marketing, et deux méritent d'être lus attentivement car ils montrent où Opus 5 n'est pas le meilleur choix.
- Frontier-Bench v0.1 — 44,4 % (xhigh) contre 18,7 % pour Opus 4.8. C'est l'éval d'agentic-coding la plus difficile d'Anthropic — tâches à long horizon qui exigent que le modèle exécute des outils, itère et s'auto-corrige. Le saut de 2,4× au même prix est la raison la plus forte de migrer.
- SWE-bench Verified — 96,0 %. Proche du plafond. Si vous utilisiez Opus 4.8 ou Fable 5 pour des corrections de bug de style SWE-bench, Opus 5 est une mise à niveau directe. Mais SWE-bench Verified est maintenant un benchmark saturé — les petites différences ne distinguent plus les modèles comme avant.
- OSWorld 2.0 — 70,57 % contre 55,7 % pour Opus 4.8. Benchmark d'utilisation d'ordinateur. Si vous exécutez Claude for Chrome, le mode navigateur de Claude Cowork, ou tout autre outil qui clique dans une vraie UI, c'est le chiffre à surveiller.
- ARC-AGI-3 — 30,16 % (effort élevé) contre 7,78 % pour GPT-5.6 Sol et 1,52 % pour Opus 4.8. Le trophée marketing. ARC-AGI-3 teste la résolution de problèmes inédits qui résistent à la mémorisation, et Opus 5 est environ 3× le meilleur modèle suivant. Signal significatif si votre charge de travail a une vraie nouveauté ; moins pertinent s'il s'agit de variantes de choses qu'Internet a déjà résolues.
- SWE-bench Pro — 79,2 % contre 80,0 % pour Fable 5. Fable 5 devance encore Opus 5 de 0,8 pp sur le SWE-bench Pro plus difficile. Pas assez pour justifier le prix 2× de Fable 5 pour la plupart des équipes, mais si vous êtes dans le décile supérieur de complexité de code et que chaque point compte, notez-le.
- Exploitation cybersécurité — Opus 5 se situe derrière Mythos 5. Anthropic dit explicitement qu'Opus 5 n'est pas le meilleur modèle cyber. Si vous faites du travail cyber défensif via Project Glasswing, Mythos reste le choix.
Quand Opus 5 remplace Fable 5 (et quand ce n'est pas le cas)
La question intéressante que ce lancement impose : quand avez-vous vraiment besoin du tarif à $10 / $50 de Fable 5 ? L'affirmation d'Anthropic est qu'Opus 5 atteint à 0,5 % près le pic de Fable 5 sur CursorBench 3.2 à la moitié du coût, et égale le résultat OSWorld 2.0 de Fable 5 à « juste un peu plus du tiers du coût ». C'est la version forte de l'argument. La version honnête :
- Choisissez Opus 5 pour l'agentic coding, l'utilisation d'ordinateur, l'automatisation métier, le raisonnement en sciences du vivant, et tout ce où le coût par tâche résolue compte plus que les derniers 1-3 pp de qualité. C'est plus de 90 % des charges de production.
- Choisissez Fable 5 quand la charge est (a) des agents à longue durée où le run marginal bénéficie vraiment du dernier pourcent (Anthropic présente Fable 5 comme « intelligence de nouvelle génération pour agents à longue durée »), (b) des tâches de code dures de style SWE-bench Pro où vous avez mesuré un vrai écart, ou (c) toute charge où vous êtes déjà dans la courbe précision-vs-coût où 2× coût achète de la vraie qualité.
- Choisissez Mythos 5 pour du cyber défensif sur invitation via Project Glasswing.
Honest cost-per-solved-task math
# Fable 5 on a hard agentic task # ~500k input tokens, ~50k output tokens # 500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run # Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $7.50 / 0.46 = ~$16.30 # Opus 5 on the same task # Same token budget # 500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run # Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $3.75 / 0.444 = ~$8.45 # Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality. # Break-even: Fable 5 would need to be 2x cheaper per successful run, # i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.
Le nouveau palier d'effort max — quand il mérite sa place
Opus 5 introduit max comme palier explicite au-dessus de xhigh. Le thinking adaptatif s'étend désormais de low → medium → high → xhigh → max, et high est le défaut sur la Claude API et Claude Code. Deux observations tirées des benchmarks de lancement :
- Sur Frontier-Bench v0.1,
xhighmarque en réalité 44,4 % contre 43,3 % pourmax— max n'est pas strictement meilleur. Il brûle plus de tokens par tentative mais le raisonnement supplémentaire ne se convertit pas toujours sur cette éval. - Sur les tâches qui récompensent la longue délibération — ARC-AGI-3, problèmes de recherche inédits, raisonnement mathématique difficile (niveau médaille d'or IMO 2026, 42/42) — les paliers supérieurs méritent leur place.
La règle pratique : par défaut high, passez à xhigh quand votre éval montre des gains mesurables, n'utilisez max que pour les charges où vous avez vérifié que la profondeur de raisonnement compte plus que le débit. Ne réglez pas max en espérant ; mesurez.
Sciences du vivant, sécurité et posture cyber
Trois chiffres à épingler :
- Sciences du vivant. Opus 5 est à +10,2 points de pourcentage au-dessus d'Opus 4.8 en chimie organique et +7,7 pp en prédiction de protéines. Si vous construisez des agents pour la biologie structurale, la bioinformatique ou la planification de synthèse, c'est un vrai saut — pas une amélioration dans le bruit.
- Résistance à l'injection de prompt. Sur le benchmark Gray Swan, le taux de succès attaquant tombe de 5,5 % (Opus 4.8) à 2,0 %. Dans les environnements navigateur Claude Cowork, les garde-fous du mode auto amènent le succès des injections de prompt navigateur à 0 % dans les mesures d'Anthropic. Significatif pour quiconque expédie des agents de style Claude-for-Chrome.
- Classificateurs cyber. Les garde-fous cyber d'Opus 5 interviennent ~85 % moins souvent que pour Fable 5 — parce qu'Opus 5 n'est délibérément pas le meilleur modèle cyber, le taux d'intervention est atténué. Si vous voyiez des refus de sécurité fallacieux sur des prompts légitimes de recherche en sécurité sur Fable 5, Opus 5 vous semblera nettement moins prompt à s'alarmer.
Calendrier de dépréciation à planifier
- Opus 4.1 (
claude-opus-4-1-20250805) est retiré le 5 août 2026 — onze jours après le lancement d'Opus 5. Si une surface de production épingle encore Opus 4.1, migrez cette semaine. - Opus 4.5 / 4.6 / 4.7 / 4.8 restent disponibles comme « Modèles Legacy » dans l'aperçu de la plateforme, mais attendez-vous à des cycles de dépréciation standard de 12 mois. Traitez Opus 5 comme la cible de migration pour tout ce qui est nouveau.
- L'ID de modèle d'Opus 5 est un snapshot épinglé, pas un pointeur evergreen. Depuis la génération 4.6, le format d'ID sans date signifie toujours « snapshot fixe ». Un futur
claude-opus-5-1serait un nouvel ID, pas une mise à niveau silencieuse declaude-opus-5.
Essayez-le — une commande
Run Opus 5 with the recommended defaults
# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=8192, # room for adaptive thinking + response
extra_body={"effort": "high"}, # default; move to xhigh only if evals justify
system="You are a senior engineer. Answer directly and iterate until the task is complete.",
messages=[{"role": "user", "content": "..."}],
)
# Claude Code
claude --model claude-opus-5
# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast" # separate model ID, $10/$50 per MTokAntisèche
Vérifiez votre compréhension
Check yourself
0/5Pour aller plus loin
- Claude Sonnet 5 : Le Guide de Terrain — le palier équilibré et défaut de Claude Code ; la migration depuis Sonnet 4.6 a ses propres pièges 400
- Fable 5 & Mythos 5 : Le Guide de Terrain Flagship — quand le palier supérieur mérite vraiment 2× le coût
- Choisir un modèle en 2026 — l'arbre de décision sur toute la gamme Anthropic
- Thinking adaptatif & réglage de l'effort — comment l'effort se traduit en dépense réelle de tokens
- Économie du prompt caching — le calcul des hits de cache qui transforme le prix affiché d'Opus 5 en votre facture réelle
- Modèles actuels & tarifs — la table toujours à jour ; vérifiez avant d'épingler
Sources & lectures complémentaires
- Introducing Claude Opus 5 — Anthropic (24 juillet 2026) — l'annonce de lancement, les tables de benchmarks et les notes de sécurité
- Claude Platform docs — Aperçu des modèles — tables de tarification, IDs de snapshots, identifiants Bedrock/GCP, defaults d'effort
- Guide de migration — Opus 4.8 vers Opus 5 — la liste officielle des changements de contrat et l'avertissement sur l'auto-vérification
- MarkTechPost — Couverture du lancement d'Opus 5 (24 juillet 2026) — décomposition benchmark par benchmark incluant SWE-bench, ARC-AGI-3 et chiffres Chartography
- Interesting Engineering — Couverture coding d'Opus 5 — cadrage coût par tâche
- TheNextWeb — Analyse du lancement d'Opus 5 — cadence de sortie et comparaison Fable 5
- BigGo Finance — Analyse tarifaire d'Opus 5 — économie du mode rapide et changements de prompt cache
- Dépréciations de modèles — Anthropic — la date de retrait d'Opus 4.1 et la politique de cycle de vie plus large