Passa al contenuto principale

GPT-5.6 e ChatGPT Work per utenti Claude

Intermedio

Ragioni già in Claude. Poi, il 9 luglio 2026, tutta la timeline si è ribaltata: OpenAI ha rilasciato tre varianti di GPT-5.6 — Sol, Terra, Luna — e ChatGPT Work, un agente che prende un obiettivo e ci lavora in background per ore. Un collega chiede "dobbiamo passare a Sol?"; un cliente vuole che ChatGPT Work sostituisca metà di un flusso di lavoro che già fai girare in Claude. Questa pagina mappa il lancio sul tuo modello mentale di Claude e — cosa più utile — estrae le parti che la copertura giornalistica seppellisce: i prezzi reali, gli scarti esatti dei benchmark, i 1,05M di contesto che nessuno si aspettava e dove OpenAI perde ancora contro Anthropic.

What you'll learn
  • Capire cosa è davvero uscito: Sol, Terra, Luna (più Sol Ultra), tutti con finestra di contesto da 1,05M token
  • Leggere la tabella dei benchmark nel modo in cui OpenAI non l'ha pubblicata — dove GPT-5.6 è in testa e dove Claude Fable 5 vince ancora
  • Capire ChatGPT Work: non una modalità chat, ma un agente in background che restituisce ore dopo un foglio di calcolo, una presentazione, un documento o una web app finita
  • Sapere quando prendere GPT-5.6 Sol invece di Claude per coding, agenti, task su browser — e quando la risposta è ancora Claude

La versione in una frase

GPT-5.6 è un refresh a tre livelli della famiglia GPT-5 — Sol (flagship), Terra (medio), Luna (economico) — con una finestra di contesto condivisa da 1,05M token, 128K di output massimo e una dichiarazione pubblicata da OpenAI di 54% di miglior efficienza sui token nell'agentic coding; ChatGPT Work è il nuovo agente autonomo costruito sopra, consegnato come app desktop unificata che ha inglobato Codex.

La parte interessante non è il refresh del modello — quello era atteso. È la forma del rilascio: OpenAI ora spedisce modello + agente + IDE come un unico prodotto, e prezza il tier da lavoro ($1 in / $6 out su Luna) sotto il livello dove storicamente si trovano i "modelli di coding economici".

Tre cose sul lancio di GPT-5.6 che sorprendono

Tutti stanno scrivendo il riepilogo dei benchmark. Ecco le parti che la maggior parte degli utenti Claude perde alla prima lettura.

1. Tutti e tre i tier condividono lo stesso contesto da 1,05M

Non è così che OpenAI di solito spedisce. Nei refresh precedenti, il tier economico arrivava con una finestra di contesto ridotta come spinta a salire di gamma. In GPT-5.6, Sol, Terra e Luna dichiarano tutti 1,05M token di contesto e 128K di output massimo — la stessa forma. Questo significa che Luna a $1 input / $6 output per milione di token è un'opzione long-context praticabile, non solo per richieste brevi, e cambia i conti per pipeline RAG, review su interi repository e loop lunghi di strumenti. Se stavi budgetando un tier stile Claude Haiku per lavori di retrieval ad alto volume, Luna è ora il confronto obbligato.

2. ChatGPT Work non è "una modalità chat" — è un agente in background che ti consegna un file finito

Il framing usato da OpenAI è rivelatore: non chatti con ChatGPT Work, lo briefi. Prende un risultato ("costruisci un'analisi competitiva di questi cinque vendor"), raccoglie contesto dalle tue app e file collegati, spezza il lavoro in passi, lavora autonomamente per minuti o ore e consegna un artefatto finito — foglio di calcolo, presentazione, documento, report o web app funzionante. Codex è stato piegato dentro la stessa app desktop, quindi ChatGPT Work possiede anche la superficie di scrittura del codice. È la stessa scommessa sul "lavoro autonomo di lunga durata" che Anthropic ha fatto con i managed agents di Claude, ma spedita prima come prodotto per utente finale e poi come API. È uscito su Pro / Enterprise / Edu nel giorno del lancio, con Plus e Business a seguire entro pochi giorni.

3. Sol vince i benchmark pubblicati da OpenAI. Claude guida ancora SWE-Bench Pro.

Se leggi oltre il grafico marketing, il quadro è più sfumato di "Sol è il nuovo re". I numeri pubblicati da OpenAI dicono che Sol raggiunge 80 sull'Artificial Analysis Coding Agent Index (circa +2,8 vs Claude Fable 5) usando meno della metà dei token di output a circa un terzo del costo. Questa è una vittoria vera. Ma Fable 5 guida ancora SWE-Bench Pro con un margine consistente riportato — Sol qui arriva a ~64,6% — e la copertura del lancio tende a seppellirlo. Traduzione: scegli in base al workload, non in base al comunicato stampa. Per il lavoro stile "agent index" con tool e browser, Sol è ora il modello da battere. Per fix di bug su repo reali con contesto significativo, Anthropic mantiene il vantaggio.

La tabella dei tier GPT-5.6 (al 9 luglio 2026)

ModelloInput $/1MOutput $/1MContestoOutput maxPosizionamento
Sol$5$301,05M128KFlagship: ragionamento complesso, coding, scienza, agenti
Terra$2,50$151,05M128K"prestazioni GPT-5.5 a ~metà del costo" — lavoro di routine
Luna$1$61,05M128KTask ad alto volume, più semplici; long-context a basso budget
Sol Ultra(non divulgato)(non divulgato)1,05M128KTier Sol a effort più alto usato in alcuni benchmark pubblicati

Benchmark pubblicati da OpenAI (Sol / Terra / Luna):

  • Artificial Analysis Coding Agent Index v1.1: 80 / 77,4 / 74,6
  • SWE-Bench Pro: 64,6% / 63,4% / 62,7% (Claude Fable 5 guida ancora questo)
  • Terminal-Bench 2.1: 88,8% (Sol Ultra 91,9%) / 87,4% / 84,7%
  • DeepSWE v1.1: 72,7% / 69,6% / 67,2%
  • BrowseComp: 90,4% (Sol Ultra 92,2%) / 87,5% / 83,3%
  • ExploitBench: 73,5% / 52,9% / 33,2%

Vale la pena fissare quell'ultima riga — ExploitBench. Il crollo da Sol a Luna dal 73,5% al 33,2% è molto più netto di qualsiasi altro benchmark in lista, ed è per questo che OpenAI si è appoggiata alla narrativa sulla cybersecurity specificamente per Sol e perché i revisori federali hanno trattenuto il modello per test aggiuntivi prima di rilasciarlo.

ChatGPT Work, decodificato

Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 6

Cosa si trasferisce da Claude (quasi tutto)

I tuoi istinti di prompting funzionano ancora. Istruzioni chiare, forme di output esplicite, esempi few-shot e dare al modello strumenti con buone descrizioni — tutto si trasporta, perché sono proprietà dei modelli di frontiera instruction-tuned, non trucchi specifici di Claude. Per la versione approfondita di questo argomento vedi Portare i prompt tra modelli e la guida pratica ChatGPT per utenti Claude.

Due cose da resettare quando salti:

  • Forma dell'API. Anthropic usa un blocco tools sulla API messages; OpenAI usa tools su Chat Completions (o la Responses API), con lo schema di function-calling OpenAI. Stessa idea, formato di trasporto diverso.
  • Il ragionamento come modalità, non solo come slider. Claude espone un parametro thinking/effort; su GPT-5.6, i guadagni più netti compaiono quando scegli il tier giusto (Sol / Sol Ultra) invece di limitarti a tunare l'effort su quello economico. Il costo conta più che su GPT-5.5.

Provalo in poche righe

L'SDK OpenAI è invariato — basta puntare model su una variante GPT-5.6:

Chiama GPT-5.6 Sol da Python (SDK OpenAI)

from openai import OpenAI

client = OpenAI()  # uses OPENAI_API_KEY

resp = client.chat.completions.create(
  model="gpt-5.6-sol",         # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
  messages=[
      {"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
      {"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
  ],
  # tools=[...]  # OpenAI-style function/tool schema
)

print(resp.choices[0].message.content)
Guided walkthrough1 of 4
  1. Sol per coding complesso, loop di agenti o qualsiasi cosa dove avresti scelto un tier Claude Opus. Terra come workhorse di default 'GPT-5.5 a metà del costo'. Luna per retrieval, estrazione, classificazione e altri lavori ad alto volume — il contesto condiviso da 1,05M la rende un'opzione vera, non un giocattolo.

Quando scegliere GPT-5.6 invece di Claude

Nessuno dei due è strettamente migliore. Scegli GPT-5.6 quando:

  • Ti serve un tier a $1/$6 con contesto da 1,05M. Luna è attualmente il modo più economico per avere qualità long-context vicina alla frontiera; è una nuova capacità, non un rebrand.
  • Il task è browser-intensivo o a forma di agent-index. BrowseComp e il Coding Agent Index sono le carte più forti di Sol. Se il tuo agente passa la maggior parte del tempo in un browser o in una shell, Sol è il modello da battere.
  • Vuoi il flusso "briffa e dimentica" di ChatGPT Work per produrre fogli di calcolo/presentazioni/report/app finiti come artefatti per utenti finali, senza incollare a mano un framework di agent.

Scegli Claude quando vuoi la piattaforma gestita attorno al modello — prompt caching, memory and context editing, managed agents, computer use, la desktop app — e specificamente quando il workload è software engineering su repo reali, dove Fable 5 guida ancora SWE-Bench Pro con un margine ampio. Vedi Claude, GPT, Gemini per il coding per il confronto in evoluzione e quanto costa l'AI tra i vari provider per la vista sui costi.

Check yourself

0/3
  1. Quale tier GPT-5.6 ha la finestra di contesto più piccola?
  2. Cos'è ChatGPT Work, in una riga?
  3. Su quale benchmark pubblicato da OpenAI Claude Fable 5 di Anthropic guida ancora rispetto a GPT-5.6 Sol?

Fonti e approfondimenti