Aggiornamento GPT-5.6 di agosto 2026: slider di effort, pulsante Think gratis e il precipizio dei 272K
Il 6 agosto 2026 OpenAI ha spedito un refresh mid-cycle di GPT-5.6 che la maggior parte della copertura ha compresso in una sola frase: "Sol è più intelligente, gli utenti free hanno chat illimitate". L'aggiornamento reale è più interessante — e più consequenziale se sei un utente Claude che ogni tanto ricorre allo stack OpenAI. Tre pezzi si sono mossi insieme: un controllo di effort che ora vive sia nella UI di ChatGPT (come slider) sia nell'API (come parametro a sei livelli); un pulsante Think sul piano gratuito in arrivo la settimana successiva insieme a chat Luna illimitate; e il precipizio di pricing long-context a 272K token di input che interagisce in modo scomodo con la Fast mode, disponibile solo su Sol. Ciascuno sposta una decisione reale.
Questa pagina estrae quelle decisioni dalla nebbia delle release notes e mostra cosa cambia davvero per chi costruisce ragionando in termini di Claude.
- Vedere esattamente cosa è stato spedito il 6 agosto 2026 per GPT-5.6 — e cosa è stato spedito la settimana del 10 agosto per gli utenti free
- Capire il parametro di effort a sei livelli (`none, low, medium, high, xhigh, max`) e mapparlo sul modello di thinking-effort di Claude
- Imparare il precipizio di pricing a 272K token di input — e come può raddoppiare silenziosamente un job che credevi di aver budgetato
- Sapere quando la Fast mode aiuta, quando non fa nulla, e quali richieste rifiuta silenziosamente
- Decidere quando l'aggiornamento è un motivo reale per spostare un carico di lavoro da Claude a Sol — e quando no
Cosa è stato spedito davvero il 6 agosto 2026
Tre cose concrete. Il resto è rifinitura.
- Gli utenti Plus e Pro vedono un nuovo slider su web, mobile e desktop che imposta quanto reasoning ChatGPT usa per risposta. Sotto il cofano, l'API espone la stessa manopola come `reasoning.effort` con sei posizioni — `none`, `low`, `medium`, `high`, `xhigh`, `max` — con default a `medium` quando omesso. Sostituisce il precedente comportamento 'decide il modello': ora scegli tu il livello e paghi per esso.
- OpenAI ha aggiornato Sol per dare 'risposte più dirette, usare formattazione più stretta ed evitare dettaglio extra quando non aiuta', per adattare il livello di dettaglio alla domanda, e per essere 'meno probabile che concordi quando una correzione sarebbe più utile' — la cosa più vicina a un pass anti-sicofantico esplicito che OpenAI abbia mai spedito. Le eval interne su prompt finanziari, medici e legali hanno riportato errori fattuali '68% meno comuni' rispetto al ritirato GPT-5.5 Instant.
- Gli utenti free ottengono chat testuali illimitate su GPT-5.6 Luna (prima con cap) e un nuovo pulsante Think per reasoning più profondo su domande più difficili, 'soggetto a protezioni anti-abuso'. Il pulsante Think non era attivo il 6 agosto — è arrivato la settimana successiva.
Lo slider di effort — mappare i sei livelli su un modello mentale Claude
Se stai ragionando nei termini dei cinque livelli di effort di Claude (introdotti con Opus 5 a luglio), il modello mentale è simile ma le etichette non si allineano in modo pulito. GPT-5.6 ha sei livelli dove Claude ne ha cinque, e la semantica differisce ai due estremi.
| Livello GPT-5.6 | Cosa fa | Grossomodo come Claude Opus 5 |
|---|---|---|
none | Salta del tutto il reasoning; risposta istantanea | Nessun equivalente diretto — Claude pianifica sempre un po' |
low | Chain-of-thought breve, economico | effort minimal |
medium (default) | Pianificazione bilanciata; il default spedito | low–medium |
high | Pianificazione più profonda; più lenta, più cara | medium |
xhigh | Deliberazione lunga; ragionamento multi-step | high |
max | Tetto pieno del reasoning — costoso | maximum |
Due conseguenze pratiche:
- Il default si è spostato. Sull'API, se ometti
reasoning.effort, ottienimedium. Prima molti wrapper facevano affidamento sull'auto-selezione dell'effort da parte del modello; quel comportamento è sparito. Ora esplicito è obbligatorio per un costo prevedibile. noneè un pulsante reale. È genuinamente utile per prompt classificatori, estrazione strutturata o chiamate a un tool-router in cui i reasoning token sono puro overhead. Claude non ha uno switch 'off' equivalente pulito.
Un template di richiesta sicuro che fissa l'effort esplicitamente
{
"model": "gpt-5.6-sol",
"reasoning": { "effort": "low" },
"messages": [
{ "role": "system", "content": "Extract only. Output JSON." },
{ "role": "user", "content": "..." }
]
}Il precipizio di pricing a 272K token — un pericolo reale
Questo è il cambiamento che più probabilmente brucia una fattura inaspettatamente.
La regola: se l'input di una richiesta supera i 272.000 token, l'intera richiesta viene ri-prezzata a 2× la tariffa input e 1,5× la tariffa output, non solo i token oltre la soglia. Nessuna proporzione.
Due cose contano di quella regola:
- È un precipizio, non un pendio. Un prompt a 271.999 token di input paga la tariffa base. Un prompt a 272.001 paga 2×/1,5× su ogni token di input e output nella chiamata — inclusi i reasoning token che il modello genera.
- Le conversazioni lunghe strisciano oltre. Chat multi-turno e loop di agenti accumulano storia. Una sessione che parte sotto i 272K può silenziosamente attraversare la linea al turno 12 e ri-prezzare ogni turno successivo.
- Il pricing base di GPT-5.6 Sol è $5 / $30 per milione (input / output), con input in cache a $0,50. Sopra i 272K token di input, la stessa chiamata costa $10 / $45. Su un documento da 300K token con 4K di output, il costo base è $1,62. Attraversa il precipizio e diventa $3,18 — quasi 2× per un solo token oltre la soglia.
- Due chiamate da 200K costano $2 in input. Una singola chiamata da 400K costa $8 (2× input sull'intera richiesta). Chunkare è 4× più economico in input se ogni chunk resta sotto i 272K. Stuffa solo quando hai davvero bisogno che il modello veda tutto insieme.
- L'input in cache a $0,50 resta in cache a $0,50 fino a 272K. Sopra il precipizio, il moltiplicatore si applica a ogni token prezzato — incluso l'input non in cache oltre il prefisso in cache. Un prefisso stabile di 250K in cache più una coda che cresce può spingerti silenziosamente oltre.
Fast mode — piccola stampa che vale leggere
La Fast mode è un'opzione Sol-only che scambia prezzo per latenza: fino a 2,5× più veloce a 2× il prezzo API. Terra e Luna non la offrono.
Tre cose che il pitch di lancio smorza:
- 'Fino a' è un soffitto, non una norma. Lo speedup wall-clock dipende dal carico — tool call, hop di rete e velocità di streaming cappano tutti il guadagno reale ben sotto il 2,5×.
- Fast mode e long context non si mescolano bene. OpenAI non ha pubblicato una regola di mutua esclusività, ma le prime guide riportano che le richieste in Fast mode si comportano male (o degradano silenziosamente) una volta attraversata la soglia dei 272K di input. Trattatele come incompatibili finché OpenAI non documenta il contrario.
- I reasoning token contano comunque. La Fast mode rende il throughput più rapido, ma una chiamata a effort
maxgenera comunque lo stesso volume di output di reasoning. L'economia funziona solo quando stai pagando per una latenza che senti davvero."
- Il break-even della Fast mode è grossomodo 25% in più di throughput per dollaro al soffitto del 2,5× — peggio quando il soffitto non viene toccato.
- Preferisci la Fast mode per la chat interattiva in cui l'utente aspetta. Saltala per batch, agenti in background e RAG long-context.
- Se stavi per spostare una pipeline batch da Claude a Sol per il costo, non accendere la Fast mode — cancelli il risparmio.
Piano gratuito: Luna illimitato + il pulsante Think
Per un utente Claude questo conta meno delle modifiche all'API, ma è il cambiamento che più probabilmente comparirà nello screenshot di un amico e farà partire una discussione.
- Chat testuali illimitate su GPT-5.6 Luna per utenti ChatGPT free, dalla settimana del 10 agosto 2026. Prima con cap.
- Pulsante Think sulle chat free, stessa finestra. Aggiunge una passata di reasoning più profondo a un messaggio specifico, soggetto a protezioni anti-abuso. Non è la stessa UI dello slider di effort Plus/Pro — è un toggle per messaggio, non un'impostazione a livello di sessione.
La lettura pratica: OpenAI sta difendendo aggressivamente il piano gratuito ora che sia Claude sia Gemini hanno opzioni di reasoning free generose. Aspettati che il cap anti-abuso sia stretto nelle prime settimane.
Dove questo aggiornamento cambia davvero la decisione di chi usa Claude
Per la maggior parte dei carichi Claude la risposta resta la stessa. Per tre pattern specifici si sposta.
- `reasoning.effort: none` su Sol Luna ora è un'opzione plausibilmente più economica di una chiamata Claude Haiku a effort minimo per routing ad alto volume, estrazione di tag o labelling strutturato — a patto che i tuoi prompt restino ben sotto i 272K. Fai benchmark su un campione rappresentativo prima di switchare.
- Sol + Fast mode ora è il tier di qualità più veloce che OpenAI spedisce. Se un utente aspetta ogni risposta e i tuoi prompt stanno sotto i 272K, questo è l'aggiornamento che più cambia il tradeoff. Per run di agenti in background, ignoralo.
- Il precipizio dei 272K significa che dovresti progettare per esso. Il contesto da 1M di Claude Opus 5 e il contesto da 1,05M di Sol si estendono entrambi ben oltre i 272K, ma Claude non ha un precipizio della stessa forma — il suo pricing long-context è piatto. Per operazioni repo-wide a 400K+ di input, Claude ha attualmente il vantaggio di costo.
Note di migrazione per codice API GPT-5.6 esistente
Se hai spedito contro Sol prima del 6 agosto, due cose vanno cambiate:
- Imposta
reasoning.effortesplicitamente su ogni chiamata. Ometterlo ora ti costamedium; probabilmente volevilownella maggior parte dei casi. - Aggiungi una guardia sui 272K al confine della tua pipeline. Rifiuta o chunka le richieste i cui token di input superano la soglia. Un check banale di
len(input) / 4come approssimazione basta come prima linea di difesa.
Guardrail one-liner per wrapper Node.js
if (estimateTokens(input) > 260_000) { chunkOrReject(input); }Cosa non include
Due voci che circolavano attorno a questo aggiornamento non ne fanno parte:
- GPT-6 (Astra). Rumor per agosto in alcune testate, ma all'11 agosto 2026 OpenAI non ha confermato data di lancio, model card o pricing. Vedi la nostra pagina OpenAI Astra preview per cosa è effettivamente noto vs speculato.
- Calo di prezzo di Sol. La tariffa base $5 / $30 non è cambiata. Alcune coperture hanno confuso il precipizio dei 272K (una soprattassa) con un cambio di prezzo.
Provalo
Check yourself
0/4Fonti e approfondimenti
- OpenAI: GPT-5.6 August 2026 Updates (PDF) — fonte primaria per la passata comportamentale del 6 agosto e il rollout free
- Release notes ChatGPT (OpenAI Help Center) — release notes canoniche lato ChatGPT
- Release notes dei modelli (OpenAI Help Center) — note comportamentali dei modelli API
- 9to5Mac: OpenAI aggiorna ChatGPT con un GPT-5.6 Sol più intelligente e chat gratuite illimitate (6 ago 2026)
- Visual Studio Magazine: GPT-5.6 Sol Ascends for Token Efficiency (6 ago 2026)
- AIToolsReview: GPT-5.6 Review — Agosto 2026 — dettagli sullo slider di effort e sul precipizio dei 272K
- Kingy AI: GPT-5.6 Fast Mode — Speed, Pricing and Tradeoffs — moltiplicatore di pricing della Fast mode e caveat
- Coursiv Blog: GPT-5.6 Sol — Benchmarks, API Pricing & Review — parametro API
reasoning.efforta sei livelli - BenchLM: GPT-5.6 Sol Benchmarks & Pricing — pricing base e confronti benchmark
Cross-link interni ad AILmanac:
- GPT-5.6 & ChatGPT per utenti Claude — la pagina di lancio del 9 luglio 2026
- Fast Inference & Token Speed — come si confrontano i prodotti Fast-tier tra provider
- Opus 5 Field Guide — per il lato Claude del confronto sui tier di effort
- OpenAI Astra Preview — cosa si vocifera per la prossima generazione OpenAI, e cosa è effettivamente confermato