Passa al contenuto principale

Claude Opus 5: la guida sul campo

Intermedio

Il 24 luglio 2026 Anthropic ha rilasciato Claude Opus 5 (claude-opus-5) — il quarto modello in due mesi, dopo Sonnet 5 (30 giugno) e Fable 5 / Mythos 5 (9 giugno). Il titolo è volutamente noioso: stesso prezzo di $5 in / $25 out per MTok di Opus 4.8, stesso contesto da 1M, stesso cap di output a 128k. La parte interessante è cosa comprano ora quei numeri invariati: 44,4% su Frontier-Bench v0.1 contro il 18,7% di Opus 4.8 (più del doppio), 96,0% su SWE-bench Verified e 30,16% su ARC-AGI-3 — circa tre volte il 7,78% di GPT-5.6 Sol e venti volte l'1,52% di Opus 4.8. Opus 5 è ora il modello di default per Claude Max e il più potente disponibile su Claude Pro.

Questa pagina è la guida pratica sul campo: cosa significano davvero i numeri per il tuo stack, i due cambi di contratto API che genereranno errori 400 in una migrazione ingenua, quando Opus 5 sostituisce legittimamente Fable 5 (e quando no) e il nuovo tier di effort xhigh / max.

What you'll learn
  • Sapere cos'è Opus 5: contesto 1M, output 128k, $5 in / $25 out per MTok — stessa forma di Opus 4.8, numeri materialmente migliori
  • Capire i due vincoli API che rompono le migrazioni ingenue: le restrizioni sul thinking-disabled ad alto effort e il thinking attivo di default che divora il tuo budget max_tokens
  • Leggere i benchmark come fanno i lead dei team di agenti — Frontier-Bench, ARC-AGI-3, SWE-bench Pro, OSWorld 2.0 — e sapere quali sono significativi per il tuo carico di lavoro
  • Fare la matematica onesta sui prezzi: quando Opus 5 a max effort batte Fable 5 sul costo-per-task-risolto e quando no
  • Scegliere il tier di effort giusto — i nuovi tier xhigh e max si guadagnano il posto su Frontier-Bench e ARC-AGI-3, sprecano token altrove
  • Pianificare la deprecazione Opus 4.1 → Opus 5 prima della data di ritiro del 5 agosto 2026

La versione in un paragrafo

Opus 5 è un bump di capacità a pricing invariato, non una ridefinizione di prezzo. Stesso $5 / $25 per MTok di Opus 4.8, stesso contesto da 1M token, stesso output massimo di 128k sull'API Messages sincrona, stesso cutoff di conoscenza affidabile spostato a maggio 2026. Ciò che è cambiato è cosa fanno quei token: su Frontier-Bench v0.1 (l'eval per agenti di coding più duro di Anthropic) Opus 5 ottiene 44,4% a effort xhigh contro il 18,7% di Opus 4.8 — più del doppio allo stesso prezzo di listino. Su ARC-AGI-3 la risoluzione di problemi nuovi passa da 1,52% a 30,16%. Due cambi di contratto rompono le migrazioni ingenue: il thinking adattivo è attivo di default e condivide il tuo budget max_tokens con la risposta, e thinking: {"type": "disabled"} ora ritorna 400 sui nuovi tier xhigh o max. Opus 5 è il nuovo default su Claude Max, il modello più potente disponibile su Claude Pro, ed è disponibile via Claude API, Bedrock (anthropic.claude-opus-5), Google Cloud (claude-opus-5), Microsoft Foundry e Claude Platform su AWS.

Cosa è cambiato davvero rispetto a Opus 4.8

Opus 4.8 è uscito ad aprile 2026 come primo Opus con context window da 1M e thinking adattivo attivo di default. Opus 5 mantiene ognuno di quei default, quindi sul filo la forma request/response è quasi identica. Quattro cose si sono mosse:

  • I numeri. Frontier-Bench v0.1 è passato da 18,7% a 44,4% (xhigh) / 43,3% (max). SWE-bench Multimodal da 38,4% a 59,4%. OSWorld 2.0 da 55,7% a 70,57%. Zapier AutomationBench da 17,0% a 26,0%. ARC-AGI-3 da 1,52% a 30,16% ad high effort.
  • Un nuovo tier di effort max si colloca sopra xhigh, e thinking: {"type": "disabled"} non funziona più a xhigh o max (errore 400). L'intento è che a quei tier stai esplicitamente pagando per il reasoning, quindi disabilitarlo silenziosamente è ora un bug e non una preferenza.
  • L'auto-verifica è ora comportamento di default, non un'abitudine indotta dal prompt. La guida di migrazione di Anthropic ti avvisa esplicitamente di rimuovere le istruzioni manuali "controlla il tuo lavoro" — altrimenti ottieni doppia verifica e token bruciati. È la sorpresa più comune nel primo giorno di esecuzione di codice Opus 5 che prima girava su Opus 4.8.
  • Il prompt caching non si invalida più su cambi di tool a metà conversazione (beta). Se il tuo loop dell'agente scambia la lista di tool a ogni step, il prefisso della cache ora sopravvive; su Opus 4.8 pagavi una scrittura fresca ogni volta.

I due errori 400 che romperanno la migrazione

Guided walkthrough1 of 4
  1. Opus 4.8 ti permetteva di disabilitare il thinking a qualsiasi livello di effort. Opus 5 consente thinking: {"type": "disabled"} solo ad high effort o inferiore. Abbinarlo a xhigh o max è un errore hard. Se hai un wrapper che disabilita sempre il thinking (alcuni team lo fanno per mantenere le risposte concise), o abbassi effort a high o cancelli il campo thinking e lasci girare il thinking adattivo.

Migrazione minima sicura — da Opus 4.8 a Opus 5

# Before (Opus 4.8) — worked
response = client.messages.create(
  model="claude-opus-4-8",
  max_tokens=4096,
  extra_body={"effort": "max"},
  thinking={"type": "disabled"},           # allowed on 4.8 at any effort
  system="After answering, verify your work step by step.",
  messages=[...],
)

# After (Opus 5) — three edits
response = client.messages.create(
  model="claude-opus-5",
  max_tokens=16384,                        # thinking now shares this budget
  extra_body={"effort": "max"},
  # thinking={"type": "disabled"}          # 400 at xhigh/max — remove it
  system="Answer the question.",           # drop the verify instruction — Opus 5 self-verifies
  messages=[...],
)

I benchmark che contano davvero

Anthropic ha pubblicato molti numeri il giorno del lancio. Tre sono portanti per carichi di lavoro reali, uno è un trofeo di marketing, e due vale la pena leggerli con attenzione perché mostrano dove Opus 5 non è la scelta migliore.

  • Frontier-Bench v0.1 — 44,4% (xhigh) contro il 18,7% di Opus 4.8. È l'eval agentico di coding più duro di Anthropic — task a lungo orizzonte che richiedono al modello di eseguire tool, iterare e auto-correggersi. Il salto di 2,4× allo stesso prezzo è la singola ragione più forte per migrare.
  • SWE-bench Verified — 96,0%. Vicino al soffitto. Se usavi Opus 4.8 o Fable 5 per bug fix in stile SWE-bench, Opus 5 è un upgrade netto. Ma SWE-bench Verified è ormai un benchmark saturo — piccole differenze non discriminano più i modelli come una volta.
  • OSWorld 2.0 — 70,57% contro il 55,7% di Opus 4.8. Benchmark di computer use. Se stai facendo girare Claude for Chrome, la browser mode di Claude Cowork o qualsiasi altra cosa che clicca in giro su una UI reale, questo è il numero da guardare.
  • ARC-AGI-3 — 30,16% (high effort) contro il 7,78% di GPT-5.6 Sol e l'1,52% di Opus 4.8. Il trofeo di marketing. ARC-AGI-3 testa la risoluzione di problemi nuovi che resistono alla memorizzazione, e Opus 5 è circa 3× il miglior concorrente. Segnale significativo se il tuo carico di lavoro ha vera novità; meno significativo se sono varianti di cose che internet ha già risolto.
  • SWE-bench Pro — 79,2% contro l'80,0% di Fable 5. Fable 5 batte ancora Opus 5 di 0,8pp sul più duro SWE-bench Pro. Non abbastanza per giustificare il prezzo 2× di Fable 5 per la maggior parte dei team, ma se sei nel decile più alto di complessità del codice e ogni punto conta, prendi nota.
  • Sfruttamento cybersecurity — Opus 5 si posiziona dietro Mythos 5. Anthropic dice esplicitamente che Opus 5 non è il miglior modello cyber. Se stai facendo lavoro di cyber difensivo tramite Project Glasswing, Mythos resta la scelta.

Quando Opus 5 sostituisce Fable 5 (e quando no)

La domanda interessante che questo lancio impone: quando ti serve davvero il pricing $10 / $50 di Fable 5? L'affermazione di Anthropic è che Opus 5 arriva entro lo 0,5% del picco di Fable 5 su CursorBench 3.2 a metà del costo, e uguaglia il risultato di Fable 5 su OSWorld 2.0 a "poco più di un terzo del costo". Questa è la versione forte dell'argomento. La versione onesta:

  • Scegli Opus 5 per coding agentico, computer use, business automation, reasoning nelle scienze della vita, e qualsiasi cosa in cui il costo-per-task-risolto conta più dell'ultimo 1-3pp di qualità. È >90% dei carichi di lavoro in produzione.
  • Scegli Fable 5 quando il carico di lavoro è (a) agenti long-running dove la corsa marginale beneficia davvero dell'ultimo punto percentuale (Anthropic inquadra Fable 5 come "intelligenza di nuova generazione per agenti long-running"), (b) task di codice duri in stile SWE-bench Pro dove hai misurato un gap reale, o (c) qualsiasi carico dove sei già dentro la curva accuratezza-vs-costo dove 2× costo compra qualità reale.
  • Scegli Mythos 5 per cyber difensiva su invito tramite Project Glasswing.

Matematica onesta sul costo-per-task-risolto

# Fable 5 on a hard agentic task
#   ~500k input tokens, ~50k output tokens
#   500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run
#   Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $7.50 / 0.46 = ~$16.30

# Opus 5 on the same task
#   Same token budget
#   500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run
#   Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $3.75 / 0.444 = ~$8.45

# Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality.
# Break-even: Fable 5 would need to be 2x cheaper per successful run,
# i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.

Il nuovo tier di effort max — quando si guadagna il posto

Opus 5 introduce max come tier esplicito sopra xhigh. Il thinking adattivo ora spazia da low → medium → high → xhigh → max, e high è il default sulla Claude API e su Claude Code. Due osservazioni dai benchmark di lancio:

  • Su Frontier-Bench v0.1, xhigh in realtà ottiene 44,4% contro il 43,3% di max — max non è strettamente migliore. Brucia più token per tentativo ma il reasoning extra non sempre si converte su questa eval.
  • Su task che premiano la deliberazione lunga — ARC-AGI-3, problemi di ricerca nuovi, reasoning matematico duro (livello medaglia d'oro IMO 2026, 42/42) — i tier più alti si guadagnano il posto.

La regola pratica: default su high, passa a xhigh quando la tua eval mostra guadagni misurabili, usa max solo per carichi in cui hai verificato che la profondità di reasoning conta più del throughput. Non impostare max e sperare; misura.

Scienze della vita, sicurezza e postura cyber

Tre numeri da fissare:

  • Scienze della vita. Opus 5 è +10,2 punti percentuali su Opus 4.8 in chimica organica e +7,7pp in previsione di proteine. Se stai costruendo agenti per biologia strutturale, bioinformatica o planning di sintesi, questo è un salto reale — non un miglioramento nel rumore.
  • Resistenza alla prompt injection. Sul benchmark Gray Swan, il successo dell'attaccante cala dal 5,5% di Opus 4.8 al 2,0%. Negli ambienti browser di Claude Cowork, le salvaguardie auto-mode portano il successo della prompt injection sul browser allo 0% nelle misurazioni di Anthropic. Significativo per chiunque spedisca agenti in stile Claude-for-Chrome.
  • Classificatori cyber. Le salvaguardie cyber di Opus 5 intervengono ~85% meno spesso di quanto facciano per Fable 5 — poiché Opus 5 deliberatamente non è il modello cyber di punta, la rate di intervento è abbassata. Se vedevi rifiuti di sicurezza spurii su prompt legittimi di ricerca security su Fable 5, Opus 5 ti sembrerà notevolmente meno grilletto facile.

Timeline di deprecazione da pianificare

  • Opus 4.1 (claude-opus-4-1-20250805) va in ritiro il 5 agosto 2026 — undici giorni dal lancio di Opus 5. Se qualche superficie di produzione fissa ancora Opus 4.1, migra questa settimana.
  • Opus 4.5 / 4.6 / 4.7 / 4.8 restano disponibili come "modelli Legacy" nella panoramica della piattaforma, ma aspettati cicli standard di deprecazione a 12 mesi. Tratta Opus 5 come il target di migrazione per tutto il nuovo.
  • Il model ID di Opus 5 è uno snapshot fissato, non un puntatore evergreen. A partire dalla generazione 4.6, il formato dateless-ID significa ancora "snapshot fisso". Un futuro claude-opus-5-1 sarebbe un ID nuovo, non un upgrade silenzioso di claude-opus-5.

Provalo — un solo comando

Esegui Opus 5 con i default consigliati

# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()

response = client.messages.create(
  model="claude-opus-5",
  max_tokens=8192,                    # room for adaptive thinking + response
  extra_body={"effort": "high"},      # default; move to xhigh only if evals justify
  system="You are a senior engineer. Answer directly and iterate until the task is complete.",
  messages=[{"role": "user", "content": "..."}],
)

# Claude Code
claude --model claude-opus-5

# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast"  # separate model ID, $10/$50 per MTok

Cheat sheet

Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 8

Verifica la tua comprensione

Check yourself

0/5
  1. Migri un wrapper che fissava `model="claude-opus-4-8"`, `effort: "max"` e `thinking: {"type": "disabled"}` a Opus 5. Cosa succede?
  2. Il tuo prompt Opus 4.8 finisce con 'Ora verifica la tua risposta passo per passo.' Passi a Opus 5 e vedi circa il doppio del costo in token di thinking sui prompt difficili. Perché?
  3. Per un carico di lavoro agentico di coding in produzione dove il solve rate conta e il costo è un vincolo reale, quale modello supporta più fortemente i dati di lancio di Opus 5?
  4. Imposti `effort: "max"` su ogni richiesta aspettandoti qualità strettamente migliore di `xhigh`. I dati di lancio di Anthropic cosa suggeriscono?
  5. Quale di queste è la data di deprecazione da pianificare dopo il lancio di Opus 5?

Dove andare dopo

Fonti & letture ulteriori