Claude Opus 5: la guida sul campo
Il 24 luglio 2026 Anthropic ha rilasciato Claude Opus 5 (claude-opus-5) — il quarto modello in due mesi, dopo Sonnet 5 (30 giugno) e Fable 5 / Mythos 5 (9 giugno). Il titolo è volutamente noioso: stesso prezzo di $5 in / $25 out per MTok di Opus 4.8, stesso contesto da 1M, stesso cap di output a 128k. La parte interessante è cosa comprano ora quei numeri invariati: 44,4% su Frontier-Bench v0.1 contro il 18,7% di Opus 4.8 (più del doppio), 96,0% su SWE-bench Verified e 30,16% su ARC-AGI-3 — circa tre volte il 7,78% di GPT-5.6 Sol e venti volte l'1,52% di Opus 4.8. Opus 5 è ora il modello di default per Claude Max e il più potente disponibile su Claude Pro.
Questa pagina è la guida pratica sul campo: cosa significano davvero i numeri per il tuo stack, i due cambi di contratto API che genereranno errori 400 in una migrazione ingenua, quando Opus 5 sostituisce legittimamente Fable 5 (e quando no) e il nuovo tier di effort xhigh / max.
- Sapere cos'è Opus 5: contesto 1M, output 128k, $5 in / $25 out per MTok — stessa forma di Opus 4.8, numeri materialmente migliori
- Capire i due vincoli API che rompono le migrazioni ingenue: le restrizioni sul thinking-disabled ad alto effort e il thinking attivo di default che divora il tuo budget max_tokens
- Leggere i benchmark come fanno i lead dei team di agenti — Frontier-Bench, ARC-AGI-3, SWE-bench Pro, OSWorld 2.0 — e sapere quali sono significativi per il tuo carico di lavoro
- Fare la matematica onesta sui prezzi: quando Opus 5 a max effort batte Fable 5 sul costo-per-task-risolto e quando no
- Scegliere il tier di effort giusto — i nuovi tier xhigh e max si guadagnano il posto su Frontier-Bench e ARC-AGI-3, sprecano token altrove
- Pianificare la deprecazione Opus 4.1 → Opus 5 prima della data di ritiro del 5 agosto 2026
La versione in un paragrafo
Opus 5 è un bump di capacità a pricing invariato, non una ridefinizione di prezzo. Stesso $5 / $25 per MTok di Opus 4.8, stesso contesto da 1M token, stesso output massimo di 128k sull'API Messages sincrona, stesso cutoff di conoscenza affidabile spostato a maggio 2026. Ciò che è cambiato è cosa fanno quei token: su Frontier-Bench v0.1 (l'eval per agenti di coding più duro di Anthropic) Opus 5 ottiene 44,4% a effort xhigh contro il 18,7% di Opus 4.8 — più del doppio allo stesso prezzo di listino. Su ARC-AGI-3 la risoluzione di problemi nuovi passa da 1,52% a 30,16%. Due cambi di contratto rompono le migrazioni ingenue: il thinking adattivo è attivo di default e condivide il tuo budget max_tokens con la risposta, e thinking: {"type": "disabled"} ora ritorna 400 sui nuovi tier xhigh o max. Opus 5 è il nuovo default su Claude Max, il modello più potente disponibile su Claude Pro, ed è disponibile via Claude API, Bedrock (anthropic.claude-opus-5), Google Cloud (claude-opus-5), Microsoft Foundry e Claude Platform su AWS.
Cosa è cambiato davvero rispetto a Opus 4.8
Opus 4.8 è uscito ad aprile 2026 come primo Opus con context window da 1M e thinking adattivo attivo di default. Opus 5 mantiene ognuno di quei default, quindi sul filo la forma request/response è quasi identica. Quattro cose si sono mosse:
- I numeri. Frontier-Bench v0.1 è passato da 18,7% a 44,4% (xhigh) / 43,3% (max). SWE-bench Multimodal da 38,4% a 59,4%. OSWorld 2.0 da 55,7% a 70,57%. Zapier AutomationBench da 17,0% a 26,0%. ARC-AGI-3 da 1,52% a 30,16% ad high effort.
- Un nuovo tier di effort
maxsi colloca sopraxhigh, ethinking: {"type": "disabled"}non funziona più axhighomax(errore 400). L'intento è che a quei tier stai esplicitamente pagando per il reasoning, quindi disabilitarlo silenziosamente è ora un bug e non una preferenza. - L'auto-verifica è ora comportamento di default, non un'abitudine indotta dal prompt. La guida di migrazione di Anthropic ti avvisa esplicitamente di rimuovere le istruzioni manuali "controlla il tuo lavoro" — altrimenti ottieni doppia verifica e token bruciati. È la sorpresa più comune nel primo giorno di esecuzione di codice Opus 5 che prima girava su Opus 4.8.
- Il prompt caching non si invalida più su cambi di tool a metà conversazione (beta). Se il tuo loop dell'agente scambia la lista di tool a ogni step, il prefisso della cache ora sopravvive; su Opus 4.8 pagavi una scrittura fresca ogni volta.
I due errori 400 che romperanno la migrazione
- Opus 4.8 ti permetteva di disabilitare il thinking a qualsiasi livello di effort. Opus 5 consente thinking: {"type": "disabled"} solo ad high effort o inferiore. Abbinarlo a xhigh o max è un errore hard. Se hai un wrapper che disabilita sempre il thinking (alcuni team lo fanno per mantenere le risposte concise), o abbassi effort a high o cancelli il campo thinking e lasci girare il thinking adattivo.
- Stessa trappola della migrazione a Sonnet 5. max_tokens è un cap hard sull'output totale — blocchi di thinking più testo di risposta. Se hai dimensionato max_tokens per 'solo la risposta' su Opus 4.8 con thinking disabilitato, e non lo disabiliti su Opus 5, vedrai risposte troncate con stop_reason: 'max_tokens'. Alza max_tokens, abbassa effort a medium, o disabilita esplicitamente il thinking a high o inferiore.
- Ereditato da Opus 4.7 — thinking: {type: 'enabled', budget_tokens: N} ritorna 400. Usa effort al suo posto. Se calcolavi un budget per-richiesta, sostituisci quella logica con un selettore di effort; il controller adattivo ora decide quanto pensare in base alla difficoltà del task.
- Non è un 400, ma una regressione silenziosa di costo. Opus 5 itera e si auto-controlla senza essere sollecitato. Qualsiasi impalcatura 'ora verifica la tua risposta passo per passo' aggiunta su 4.6 o 4.8 innescherà una seconda passata di verifica e raddoppierà circa i token di thinking sui prompt difficili. Cancella quelle istruzioni e ri-esegui la tua eval.
Migrazione minima sicura — da Opus 4.8 a Opus 5
# Before (Opus 4.8) — worked
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=4096,
extra_body={"effort": "max"},
thinking={"type": "disabled"}, # allowed on 4.8 at any effort
system="After answering, verify your work step by step.",
messages=[...],
)
# After (Opus 5) — three edits
response = client.messages.create(
model="claude-opus-5",
max_tokens=16384, # thinking now shares this budget
extra_body={"effort": "max"},
# thinking={"type": "disabled"} # 400 at xhigh/max — remove it
system="Answer the question.", # drop the verify instruction — Opus 5 self-verifies
messages=[...],
)I benchmark che contano davvero
Anthropic ha pubblicato molti numeri il giorno del lancio. Tre sono portanti per carichi di lavoro reali, uno è un trofeo di marketing, e due vale la pena leggerli con attenzione perché mostrano dove Opus 5 non è la scelta migliore.
- Frontier-Bench v0.1 — 44,4% (xhigh) contro il 18,7% di Opus 4.8. È l'eval agentico di coding più duro di Anthropic — task a lungo orizzonte che richiedono al modello di eseguire tool, iterare e auto-correggersi. Il salto di 2,4× allo stesso prezzo è la singola ragione più forte per migrare.
- SWE-bench Verified — 96,0%. Vicino al soffitto. Se usavi Opus 4.8 o Fable 5 per bug fix in stile SWE-bench, Opus 5 è un upgrade netto. Ma SWE-bench Verified è ormai un benchmark saturo — piccole differenze non discriminano più i modelli come una volta.
- OSWorld 2.0 — 70,57% contro il 55,7% di Opus 4.8. Benchmark di computer use. Se stai facendo girare Claude for Chrome, la browser mode di Claude Cowork o qualsiasi altra cosa che clicca in giro su una UI reale, questo è il numero da guardare.
- ARC-AGI-3 — 30,16% (high effort) contro il 7,78% di GPT-5.6 Sol e l'1,52% di Opus 4.8. Il trofeo di marketing. ARC-AGI-3 testa la risoluzione di problemi nuovi che resistono alla memorizzazione, e Opus 5 è circa 3× il miglior concorrente. Segnale significativo se il tuo carico di lavoro ha vera novità; meno significativo se sono varianti di cose che internet ha già risolto.
- SWE-bench Pro — 79,2% contro l'80,0% di Fable 5. Fable 5 batte ancora Opus 5 di 0,8pp sul più duro SWE-bench Pro. Non abbastanza per giustificare il prezzo 2× di Fable 5 per la maggior parte dei team, ma se sei nel decile più alto di complessità del codice e ogni punto conta, prendi nota.
- Sfruttamento cybersecurity — Opus 5 si posiziona dietro Mythos 5. Anthropic dice esplicitamente che Opus 5 non è il miglior modello cyber. Se stai facendo lavoro di cyber difensivo tramite Project Glasswing, Mythos resta la scelta.
Quando Opus 5 sostituisce Fable 5 (e quando no)
La domanda interessante che questo lancio impone: quando ti serve davvero il pricing $10 / $50 di Fable 5? L'affermazione di Anthropic è che Opus 5 arriva entro lo 0,5% del picco di Fable 5 su CursorBench 3.2 a metà del costo, e uguaglia il risultato di Fable 5 su OSWorld 2.0 a "poco più di un terzo del costo". Questa è la versione forte dell'argomento. La versione onesta:
- Scegli Opus 5 per coding agentico, computer use, business automation, reasoning nelle scienze della vita, e qualsiasi cosa in cui il costo-per-task-risolto conta più dell'ultimo 1-3pp di qualità. È >90% dei carichi di lavoro in produzione.
- Scegli Fable 5 quando il carico di lavoro è (a) agenti long-running dove la corsa marginale beneficia davvero dell'ultimo punto percentuale (Anthropic inquadra Fable 5 come "intelligenza di nuova generazione per agenti long-running"), (b) task di codice duri in stile SWE-bench Pro dove hai misurato un gap reale, o (c) qualsiasi carico dove sei già dentro la curva accuratezza-vs-costo dove 2× costo compra qualità reale.
- Scegli Mythos 5 per cyber difensiva su invito tramite Project Glasswing.
Matematica onesta sul costo-per-task-risolto
# Fable 5 on a hard agentic task # ~500k input tokens, ~50k output tokens # 500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run # Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $7.50 / 0.46 = ~$16.30 # Opus 5 on the same task # Same token budget # 500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run # Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $3.75 / 0.444 = ~$8.45 # Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality. # Break-even: Fable 5 would need to be 2x cheaper per successful run, # i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.
Il nuovo tier di effort max — quando si guadagna il posto
Opus 5 introduce max come tier esplicito sopra xhigh. Il thinking adattivo ora spazia da low → medium → high → xhigh → max, e high è il default sulla Claude API e su Claude Code. Due osservazioni dai benchmark di lancio:
- Su Frontier-Bench v0.1,
xhighin realtà ottiene 44,4% contro il 43,3% dimax— max non è strettamente migliore. Brucia più token per tentativo ma il reasoning extra non sempre si converte su questa eval. - Su task che premiano la deliberazione lunga — ARC-AGI-3, problemi di ricerca nuovi, reasoning matematico duro (livello medaglia d'oro IMO 2026, 42/42) — i tier più alti si guadagnano il posto.
La regola pratica: default su high, passa a xhigh quando la tua eval mostra guadagni misurabili, usa max solo per carichi in cui hai verificato che la profondità di reasoning conta più del throughput. Non impostare max e sperare; misura.
Scienze della vita, sicurezza e postura cyber
Tre numeri da fissare:
- Scienze della vita. Opus 5 è +10,2 punti percentuali su Opus 4.8 in chimica organica e +7,7pp in previsione di proteine. Se stai costruendo agenti per biologia strutturale, bioinformatica o planning di sintesi, questo è un salto reale — non un miglioramento nel rumore.
- Resistenza alla prompt injection. Sul benchmark Gray Swan, il successo dell'attaccante cala dal 5,5% di Opus 4.8 al 2,0%. Negli ambienti browser di Claude Cowork, le salvaguardie auto-mode portano il successo della prompt injection sul browser allo 0% nelle misurazioni di Anthropic. Significativo per chiunque spedisca agenti in stile Claude-for-Chrome.
- Classificatori cyber. Le salvaguardie cyber di Opus 5 intervengono ~85% meno spesso di quanto facciano per Fable 5 — poiché Opus 5 deliberatamente non è il modello cyber di punta, la rate di intervento è abbassata. Se vedevi rifiuti di sicurezza spurii su prompt legittimi di ricerca security su Fable 5, Opus 5 ti sembrerà notevolmente meno grilletto facile.
Timeline di deprecazione da pianificare
- Opus 4.1 (
claude-opus-4-1-20250805) va in ritiro il 5 agosto 2026 — undici giorni dal lancio di Opus 5. Se qualche superficie di produzione fissa ancora Opus 4.1, migra questa settimana. - Opus 4.5 / 4.6 / 4.7 / 4.8 restano disponibili come "modelli Legacy" nella panoramica della piattaforma, ma aspettati cicli standard di deprecazione a 12 mesi. Tratta Opus 5 come il target di migrazione per tutto il nuovo.
- Il model ID di Opus 5 è uno snapshot fissato, non un puntatore evergreen. A partire dalla generazione 4.6, il formato dateless-ID significa ancora "snapshot fisso". Un futuro
claude-opus-5-1sarebbe un ID nuovo, non un upgrade silenzioso diclaude-opus-5.
Provalo — un solo comando
Esegui Opus 5 con i default consigliati
# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=8192, # room for adaptive thinking + response
extra_body={"effort": "high"}, # default; move to xhigh only if evals justify
system="You are a senior engineer. Answer directly and iterate until the task is complete.",
messages=[{"role": "user", "content": "..."}],
)
# Claude Code
claude --model claude-opus-5
# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast" # separate model ID, $10/$50 per MTokCheat sheet
Verifica la tua comprensione
Check yourself
0/5Dove andare dopo
- Claude Sonnet 5: la guida sul campo — il tier bilanciato e il default di Claude Code; migrare da Sonnet 4.6 ha le sue trappole 400
- Fable 5 & Mythos 5: la guida sul campo flagship — quando il tier di punta si guadagna davvero 2× il costo
- Scegliere un modello nel 2026 — l'albero decisionale sull'intera lineup Anthropic
- Thinking adattivo & tuning dell'effort — come l'effort mappa sulla spesa reale in token
- Economia del prompt caching — la matematica dei cache-hit che trasforma il prezzo di copertina di Opus 5 nella tua bolletta reale
- Modelli & Pricing correnti — la tabella sempre aggiornata; controlla prima di fissare
Fonti & letture ulteriori
- Introducing Claude Opus 5 — Anthropic (24 luglio 2026) — il post di lancio, tabelle di benchmark e note di sicurezza
- Claude Platform docs — Models overview — tabelle di pricing, ID di snapshot, identificatori Bedrock/GCP, default di effort
- Migration guide — Opus 4.8 to Opus 5 — la lista ufficiale dei cambi di contratto e l'avviso sull'auto-verifica
- MarkTechPost — Opus 5 launch coverage (24 luglio 2026) — breakdown benchmark-per-benchmark inclusi SWE-bench, ARC-AGI-3 e i numeri Chartography
- Interesting Engineering — Opus 5 coding coverage — framing costo-per-task
- TheNextWeb — Opus 5 launch analysis — cadenza di rilascio e confronto Fable 5
- BigGo Finance — Opus 5 pricing analysis — economia del fast mode e cambi al prompt cache
- Model deprecations — Anthropic — la data di ritiro di Opus 4.1 e la policy di ciclo di vita più ampia