GPT-5.6 e ChatGPT Work per utenti Claude
Ragioni già in Claude. Poi, il 9 luglio 2026, tutta la timeline si è ribaltata: OpenAI ha rilasciato tre varianti di GPT-5.6 — Sol, Terra, Luna — e ChatGPT Work, un agente che prende un obiettivo e ci lavora in background per ore. Un collega chiede "dobbiamo passare a Sol?"; un cliente vuole che ChatGPT Work sostituisca metà di un flusso di lavoro che già fai girare in Claude. Questa pagina mappa il lancio sul tuo modello mentale di Claude e — cosa più utile — estrae le parti che la copertura giornalistica seppellisce: i prezzi reali, gli scarti esatti dei benchmark, i 1,05M di contesto che nessuno si aspettava e dove OpenAI perde ancora contro Anthropic.
- Capire cosa è davvero uscito: Sol, Terra, Luna (più Sol Ultra), tutti con finestra di contesto da 1,05M token
- Leggere la tabella dei benchmark nel modo in cui OpenAI non l'ha pubblicata — dove GPT-5.6 è in testa e dove Claude Fable 5 vince ancora
- Capire ChatGPT Work: non una modalità chat, ma un agente in background che restituisce ore dopo un foglio di calcolo, una presentazione, un documento o una web app finita
- Sapere quando prendere GPT-5.6 Sol invece di Claude per coding, agenti, task su browser — e quando la risposta è ancora Claude
La versione in una frase
GPT-5.6 è un refresh a tre livelli della famiglia GPT-5 — Sol (flagship), Terra (medio), Luna (economico) — con una finestra di contesto condivisa da 1,05M token, 128K di output massimo e una dichiarazione pubblicata da OpenAI di 54% di miglior efficienza sui token nell'agentic coding; ChatGPT Work è il nuovo agente autonomo costruito sopra, consegnato come app desktop unificata che ha inglobato Codex.
La parte interessante non è il refresh del modello — quello era atteso. È la forma del rilascio: OpenAI ora spedisce modello + agente + IDE come un unico prodotto, e prezza il tier da lavoro ($1 in / $6 out su Luna) sotto il livello dove storicamente si trovano i "modelli di coding economici".
Tre cose sul lancio di GPT-5.6 che sorprendono
Tutti stanno scrivendo il riepilogo dei benchmark. Ecco le parti che la maggior parte degli utenti Claude perde alla prima lettura.
1. Tutti e tre i tier condividono lo stesso contesto da 1,05M
Non è così che OpenAI di solito spedisce. Nei refresh precedenti, il tier economico arrivava con una finestra di contesto ridotta come spinta a salire di gamma. In GPT-5.6, Sol, Terra e Luna dichiarano tutti 1,05M token di contesto e 128K di output massimo — la stessa forma. Questo significa che Luna a $1 input / $6 output per milione di token è un'opzione long-context praticabile, non solo per richieste brevi, e cambia i conti per pipeline RAG, review su interi repository e loop lunghi di strumenti. Se stavi budgetando un tier stile Claude Haiku per lavori di retrieval ad alto volume, Luna è ora il confronto obbligato.
2. ChatGPT Work non è "una modalità chat" — è un agente in background che ti consegna un file finito
Il framing usato da OpenAI è rivelatore: non chatti con ChatGPT Work, lo briefi. Prende un risultato ("costruisci un'analisi competitiva di questi cinque vendor"), raccoglie contesto dalle tue app e file collegati, spezza il lavoro in passi, lavora autonomamente per minuti o ore e consegna un artefatto finito — foglio di calcolo, presentazione, documento, report o web app funzionante. Codex è stato piegato dentro la stessa app desktop, quindi ChatGPT Work possiede anche la superficie di scrittura del codice. È la stessa scommessa sul "lavoro autonomo di lunga durata" che Anthropic ha fatto con i managed agents di Claude, ma spedita prima come prodotto per utente finale e poi come API. È uscito su Pro / Enterprise / Edu nel giorno del lancio, con Plus e Business a seguire entro pochi giorni.
3. Sol vince i benchmark pubblicati da OpenAI. Claude guida ancora SWE-Bench Pro.
Se leggi oltre il grafico marketing, il quadro è più sfumato di "Sol è il nuovo re". I numeri pubblicati da OpenAI dicono che Sol raggiunge 80 sull'Artificial Analysis Coding Agent Index (circa +2,8 vs Claude Fable 5) usando meno della metà dei token di output a circa un terzo del costo. Questa è una vittoria vera. Ma Fable 5 guida ancora SWE-Bench Pro con un margine consistente riportato — Sol qui arriva a ~64,6% — e la copertura del lancio tende a seppellirlo. Traduzione: scegli in base al workload, non in base al comunicato stampa. Per il lavoro stile "agent index" con tool e browser, Sol è ora il modello da battere. Per fix di bug su repo reali con contesto significativo, Anthropic mantiene il vantaggio.
La tabella dei tier GPT-5.6 (al 9 luglio 2026)
| Modello | Input $/1M | Output $/1M | Contesto | Output max | Posizionamento |
|---|---|---|---|---|---|
| Sol | $5 | $30 | 1,05M | 128K | Flagship: ragionamento complesso, coding, scienza, agenti |
| Terra | $2,50 | $15 | 1,05M | 128K | "prestazioni GPT-5.5 a ~metà del costo" — lavoro di routine |
| Luna | $1 | $6 | 1,05M | 128K | Task ad alto volume, più semplici; long-context a basso budget |
| Sol Ultra | (non divulgato) | (non divulgato) | 1,05M | 128K | Tier Sol a effort più alto usato in alcuni benchmark pubblicati |
Benchmark pubblicati da OpenAI (Sol / Terra / Luna):
- Artificial Analysis Coding Agent Index v1.1: 80 / 77,4 / 74,6
- SWE-Bench Pro: 64,6% / 63,4% / 62,7% (Claude Fable 5 guida ancora questo)
- Terminal-Bench 2.1: 88,8% (Sol Ultra 91,9%) / 87,4% / 84,7%
- DeepSWE v1.1: 72,7% / 69,6% / 67,2%
- BrowseComp: 90,4% (Sol Ultra 92,2%) / 87,5% / 83,3%
- ExploitBench: 73,5% / 52,9% / 33,2%
Vale la pena fissare quell'ultima riga — ExploitBench. Il crollo da Sol a Luna dal 73,5% al 33,2% è molto più netto di qualsiasi altro benchmark in lista, ed è per questo che OpenAI si è appoggiata alla narrativa sulla cybersecurity specificamente per Sol e perché i revisori federali hanno trattenuto il modello per test aggiuntivi prima di rilasciarlo.
ChatGPT Work, decodificato
Cosa si trasferisce da Claude (quasi tutto)
I tuoi istinti di prompting funzionano ancora. Istruzioni chiare, forme di output esplicite, esempi few-shot e dare al modello strumenti con buone descrizioni — tutto si trasporta, perché sono proprietà dei modelli di frontiera instruction-tuned, non trucchi specifici di Claude. Per la versione approfondita di questo argomento vedi Portare i prompt tra modelli e la guida pratica ChatGPT per utenti Claude.
Due cose da resettare quando salti:
- Forma dell'API. Anthropic usa un blocco
toolssulla APImessages; OpenAI usatoolssu Chat Completions (o la Responses API), con lo schema di function-calling OpenAI. Stessa idea, formato di trasporto diverso. - Il ragionamento come modalità, non solo come slider. Claude espone un parametro thinking/effort; su GPT-5.6, i guadagni più netti compaiono quando scegli il tier giusto (Sol / Sol Ultra) invece di limitarti a tunare l'effort su quello economico. Il costo conta più che su GPT-5.5.
Provalo in poche righe
L'SDK OpenAI è invariato — basta puntare model su una variante GPT-5.6:
Chiama GPT-5.6 Sol da Python (SDK OpenAI)
from openai import OpenAI
client = OpenAI() # uses OPENAI_API_KEY
resp = client.chat.completions.create(
model="gpt-5.6-sol", # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
messages=[
{"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
{"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
],
# tools=[...] # OpenAI-style function/tool schema
)
print(resp.choices[0].message.content)- Sol per coding complesso, loop di agenti o qualsiasi cosa dove avresti scelto un tier Claude Opus. Terra come workhorse di default 'GPT-5.5 a metà del costo'. Luna per retrieval, estrazione, classificazione e altri lavori ad alto volume — il contesto condiviso da 1,05M la rende un'opzione vera, non un giocattolo.
- Se la richiesta ha un artefatto definibile alla fine (foglio di calcolo, presentazione, report, piccola web app), briffa ChatGPT Work e lascialo girare. Se è una conversazione o un aiuto decisionale, resta in una chat normale.
- Descrivi ogni tool come se fosse una buona product spec: nome chiaro, scopo in una riga, descrizioni dei parametri con esempi. GPT-5.6 risponde alla stessa disciplina 'dai i tool come li daresti a un junior' di Claude.
- I prezzi Sol/Terra/Luna sono 6× più costosi in output che in input. La dichiarazione del 54% di efficienza è esattamente sull'*output* — verificala sul tuo workload prima di trasferire un budget da Claude.
Quando scegliere GPT-5.6 invece di Claude
Nessuno dei due è strettamente migliore. Scegli GPT-5.6 quando:
- Ti serve un tier a $1/$6 con contesto da 1,05M. Luna è attualmente il modo più economico per avere qualità long-context vicina alla frontiera; è una nuova capacità, non un rebrand.
- Il task è browser-intensivo o a forma di agent-index. BrowseComp e il Coding Agent Index sono le carte più forti di Sol. Se il tuo agente passa la maggior parte del tempo in un browser o in una shell, Sol è il modello da battere.
- Vuoi il flusso "briffa e dimentica" di ChatGPT Work per produrre fogli di calcolo/presentazioni/report/app finiti come artefatti per utenti finali, senza incollare a mano un framework di agent.
Scegli Claude quando vuoi la piattaforma gestita attorno al modello — prompt caching, memory and context editing, managed agents, computer use, la desktop app — e specificamente quando il workload è software engineering su repo reali, dove Fable 5 guida ancora SWE-Bench Pro con un margine ampio. Vedi Claude, GPT, Gemini per il coding per il confronto in evoluzione e quanto costa l'AI tra i vari provider per la vista sui costi.
Check yourself
0/3Fonti e approfondimenti
- OpenAI launches its new family of models with GPT-5.6 (TechCrunch, 9 luglio 2026) — copertura del lancio: varianti, prezzi, rollout di ChatGPT Work, la citazione "54% di maggior efficienza sui token", confronto con Fable 5
- OpenAI gets permission to roll out GPT-5.6 to the public on July 9 (Engadget) — processo di revisione governativa, Center for AI Standards and Innovation, rollout a fasi
- OpenAI Debuts ChatGPT Work Workplace AI Agent With GPT-5.6 (Forbes) — citazioni di Altman, posizionamento sul workplace, confronto con Claude
- OpenAI Launches ChatGPT Work Agent to Handle Complex Tasks (Bloomberg) — framing dell'autonomia "per ore", fusione con Codex
- GPT-5.6: Models Explained, Benchmarks & Access (CometAPI) — tabella completa dei benchmark (SWE-Bench Pro, Terminal-Bench 2.1, DeepSWE, BrowseComp, ExploitBench, Coding Agent Index), cifre di 1,05M contesto / 128K output
- Correlati su AILmanac: ChatGPT per utenti Claude · Claude, GPT e Gemini per il coding · Portare i prompt tra modelli · Quanto costa l'AI tra i provider · CLI per coding agent a confronto