Passa al contenuto principale

Aggiornamento GPT-5.6 di agosto 2026: slider di effort, pulsante Think gratis e il precipizio dei 272K

Intermedio

Il 6 agosto 2026 OpenAI ha spedito un refresh mid-cycle di GPT-5.6 che la maggior parte della copertura ha compresso in una sola frase: "Sol è più intelligente, gli utenti free hanno chat illimitate". L'aggiornamento reale è più interessante — e più consequenziale se sei un utente Claude che ogni tanto ricorre allo stack OpenAI. Tre pezzi si sono mossi insieme: un controllo di effort che ora vive sia nella UI di ChatGPT (come slider) sia nell'API (come parametro a sei livelli); un pulsante Think sul piano gratuito in arrivo la settimana successiva insieme a chat Luna illimitate; e il precipizio di pricing long-context a 272K token di input che interagisce in modo scomodo con la Fast mode, disponibile solo su Sol. Ciascuno sposta una decisione reale.

Questa pagina estrae quelle decisioni dalla nebbia delle release notes e mostra cosa cambia davvero per chi costruisce ragionando in termini di Claude.

What you'll learn
  • Vedere esattamente cosa è stato spedito il 6 agosto 2026 per GPT-5.6 — e cosa è stato spedito la settimana del 10 agosto per gli utenti free
  • Capire il parametro di effort a sei livelli (`none, low, medium, high, xhigh, max`) e mapparlo sul modello di thinking-effort di Claude
  • Imparare il precipizio di pricing a 272K token di input — e come può raddoppiare silenziosamente un job che credevi di aver budgetato
  • Sapere quando la Fast mode aiuta, quando non fa nulla, e quali richieste rifiuta silenziosamente
  • Decidere quando l'aggiornamento è un motivo reale per spostare un carico di lavoro da Claude a Sol — e quando no

Cosa è stato spedito davvero il 6 agosto 2026

Tre cose concrete. Il resto è rifinitura.

Guided walkthrough1 of 3
  1. Gli utenti Plus e Pro vedono un nuovo slider su web, mobile e desktop che imposta quanto reasoning ChatGPT usa per risposta. Sotto il cofano, l'API espone la stessa manopola come `reasoning.effort` con sei posizioni — `none`, `low`, `medium`, `high`, `xhigh`, `max` — con default a `medium` quando omesso. Sostituisce il precedente comportamento 'decide il modello': ora scegli tu il livello e paghi per esso.

Lo slider di effort — mappare i sei livelli su un modello mentale Claude

Se stai ragionando nei termini dei cinque livelli di effort di Claude (introdotti con Opus 5 a luglio), il modello mentale è simile ma le etichette non si allineano in modo pulito. GPT-5.6 ha sei livelli dove Claude ne ha cinque, e la semantica differisce ai due estremi.

Livello GPT-5.6Cosa faGrossomodo come Claude Opus 5
noneSalta del tutto il reasoning; risposta istantaneaNessun equivalente diretto — Claude pianifica sempre un po'
lowChain-of-thought breve, economicoeffort minimal
medium (default)Pianificazione bilanciata; il default speditolowmedium
highPianificazione più profonda; più lenta, più caramedium
xhighDeliberazione lunga; ragionamento multi-stephigh
maxTetto pieno del reasoning — costosomaximum

Due conseguenze pratiche:

  • Il default si è spostato. Sull'API, se ometti reasoning.effort, ottieni medium. Prima molti wrapper facevano affidamento sull'auto-selezione dell'effort da parte del modello; quel comportamento è sparito. Ora esplicito è obbligatorio per un costo prevedibile.
  • none è un pulsante reale. È genuinamente utile per prompt classificatori, estrazione strutturata o chiamate a un tool-router in cui i reasoning token sono puro overhead. Claude non ha uno switch 'off' equivalente pulito.

Un template di richiesta sicuro che fissa l'effort esplicitamente

{
"model": "gpt-5.6-sol",
"reasoning": { "effort": "low" },
"messages": [
  { "role": "system", "content": "Extract only. Output JSON." },
  { "role": "user", "content": "..." }
]
}

Il precipizio di pricing a 272K token — un pericolo reale

Questo è il cambiamento che più probabilmente brucia una fattura inaspettatamente.

La regola: se l'input di una richiesta supera i 272.000 token, l'intera richiesta viene ri-prezzata a 2× la tariffa input e 1,5× la tariffa output, non solo i token oltre la soglia. Nessuna proporzione.

Due cose contano di quella regola:

  1. È un precipizio, non un pendio. Un prompt a 271.999 token di input paga la tariffa base. Un prompt a 272.001 paga 2×/1,5× su ogni token di input e output nella chiamata — inclusi i reasoning token che il modello genera.
  2. Le conversazioni lunghe strisciano oltre. Chat multi-turno e loop di agenti accumulano storia. Una sessione che parte sotto i 272K può silenziosamente attraversare la linea al turno 12 e ri-prezzare ogni turno successivo.
Guided walkthrough1 of 3
  1. Il pricing base di GPT-5.6 Sol è $5 / $30 per milione (input / output), con input in cache a $0,50. Sopra i 272K token di input, la stessa chiamata costa $10 / $45. Su un documento da 300K token con 4K di output, il costo base è $1,62. Attraversa il precipizio e diventa $3,18 — quasi 2× per un solo token oltre la soglia.

Fast mode — piccola stampa che vale leggere

La Fast mode è un'opzione Sol-only che scambia prezzo per latenza: fino a 2,5× più veloce a 2× il prezzo API. Terra e Luna non la offrono.

Tre cose che il pitch di lancio smorza:

  • 'Fino a' è un soffitto, non una norma. Lo speedup wall-clock dipende dal carico — tool call, hop di rete e velocità di streaming cappano tutti il guadagno reale ben sotto il 2,5×.
  • Fast mode e long context non si mescolano bene. OpenAI non ha pubblicato una regola di mutua esclusività, ma le prime guide riportano che le richieste in Fast mode si comportano male (o degradano silenziosamente) una volta attraversata la soglia dei 272K di input. Trattatele come incompatibili finché OpenAI non documenta il contrario.
  • I reasoning token contano comunque. La Fast mode rende il throughput più rapido, ma una chiamata a effort max genera comunque lo stesso volume di output di reasoning. L'economia funziona solo quando stai pagando per una latenza che senti davvero."
Pro tip
  • Il break-even della Fast mode è grossomodo 25% in più di throughput per dollaro al soffitto del 2,5× — peggio quando il soffitto non viene toccato.
  • Preferisci la Fast mode per la chat interattiva in cui l'utente aspetta. Saltala per batch, agenti in background e RAG long-context.
  • Se stavi per spostare una pipeline batch da Claude a Sol per il costo, non accendere la Fast mode — cancelli il risparmio.

Piano gratuito: Luna illimitato + il pulsante Think

Per un utente Claude questo conta meno delle modifiche all'API, ma è il cambiamento che più probabilmente comparirà nello screenshot di un amico e farà partire una discussione.

  • Chat testuali illimitate su GPT-5.6 Luna per utenti ChatGPT free, dalla settimana del 10 agosto 2026. Prima con cap.
  • Pulsante Think sulle chat free, stessa finestra. Aggiunge una passata di reasoning più profondo a un messaggio specifico, soggetto a protezioni anti-abuso. Non è la stessa UI dello slider di effort Plus/Pro — è un toggle per messaggio, non un'impostazione a livello di sessione.

La lettura pratica: OpenAI sta difendendo aggressivamente il piano gratuito ora che sia Claude sia Gemini hanno opzioni di reasoning free generose. Aspettati che il cap anti-abuso sia stretto nelle prime settimane.

Dove questo aggiornamento cambia davvero la decisione di chi usa Claude

Per la maggior parte dei carichi Claude la risposta resta la stessa. Per tre pattern specifici si sposta.

Guided walkthrough1 of 3
  1. `reasoning.effort: none` su Sol Luna ora è un'opzione plausibilmente più economica di una chiamata Claude Haiku a effort minimo per routing ad alto volume, estrazione di tag o labelling strutturato — a patto che i tuoi prompt restino ben sotto i 272K. Fai benchmark su un campione rappresentativo prima di switchare.

Note di migrazione per codice API GPT-5.6 esistente

Se hai spedito contro Sol prima del 6 agosto, due cose vanno cambiate:

  • Imposta reasoning.effort esplicitamente su ogni chiamata. Ometterlo ora ti costa medium; probabilmente volevi low nella maggior parte dei casi.
  • Aggiungi una guardia sui 272K al confine della tua pipeline. Rifiuta o chunka le richieste i cui token di input superano la soglia. Un check banale di len(input) / 4 come approssimazione basta come prima linea di difesa.

Guardrail one-liner per wrapper Node.js

if (estimateTokens(input) > 260_000) { chunkOrReject(input); }

Cosa non include

Due voci che circolavano attorno a questo aggiornamento non ne fanno parte:

  • GPT-6 (Astra). Rumor per agosto in alcune testate, ma all'11 agosto 2026 OpenAI non ha confermato data di lancio, model card o pricing. Vedi la nostra pagina OpenAI Astra preview per cosa è effettivamente noto vs speculato.
  • Calo di prezzo di Sol. La tariffa base $5 / $30 non è cambiata. Alcune coperture hanno confuso il precipizio dei 272K (una soprattassa) con un cambio di prezzo.

Provalo

Check yourself

0/4
  1. Invii un prompt di input da 300.000 token a GPT-5.6 Sol a pricing base. Grossomodo, cosa succede al costo rispetto a inviare 271.000 token?
  2. Sull'API, ometti `reasoning.effort` su una chiamata GPT-5.6 Sol dopo l'aggiornamento del 6 agosto. Che livello di effort ottieni?
  3. Quale di questi carichi beneficia di più della Fast mode?
  4. Quale cambio di comportamento ha spedito OpenAI per GPT-5.6 Sol il 6 agosto 2026?

Fonti e approfondimenti

Cross-link interni ad AILmanac: