GPT-5.6-Cyber e Daybreak Red: il primo modello di frontiera 'offense-grade'
- Capire cosa OpenAI ha davvero rilasciato il 10 agosto 2026 — il modello, il programma di accesso Daybreak a due livelli e il cambio di guardrail che ha reso possibile il 95% di completamento
- Leggere onestamente il tasso del 95%: da quale benchmark viene, cosa non misura e perché la narrativa della 'scoperta di zero-day' sovrastima la realtà
- Vedere dove GPT-5.6-Cyber è peggio di Sol — la debolezza sui report aperti che OpenAI pubblica e che gran parte della copertura mediatica salta
- Conoscere i controlli di accesso concreti (verifica identità, chiavi hardware obbligatorie dal 1° settembre, split partner-cliente) e perché contano per chi ci vuole costruire sopra
- Decidere quando questo impatta un workflow cyber basato su Claude e quando no — inclusa la risposta onesta per i red team che già si appoggiano su Opus 5
Il 10 agosto 2026 OpenAI ha annunciato GPT-5.6-Cyber — il primo modello di frontiera che un laboratorio AI abbia rilasciato con l'obiettivo esplicito di completare più richieste offensive di cybersecurity, non meno. È costruito sulla stessa base di GPT-5.6 Sol (vedi la nostra pagina sull'aggiornamento di agosto) e fa lo stesso ragionamento sottostante. Il cambiamento non è che sappia fare di più — è che rifiuta di meno. Nel benchmark interno di OpenAI, Sol completa circa l'1,5% dei prompt di exploit-chain / privilege escalation / bypass di autenticazione. GPT-5.6-Cyber ne completa il 95,0% dello stesso set.
Quel singolo delta — da ~1,5% a ~95% di completamento su richieste in forma offensiva — è tutta la storia. Tutto il resto è il wrapper che OpenAI ci ha costruito intorno: un programma di accesso a due livelli (Daybreak Blue e Daybreak Red), una lista di partner presa quasi interamente da vendor e consulenze di sicurezza di alto livello, e un set di controlli (verifica identità, activation classifier, chiavi hardware dal 1° settembre) pensati per far restare quel delta dentro il perimetro del "lavoro di cybersecurity autorizzato".
Questa pagina scompatta cosa è genuinamente nuovo, cosa viene sovraffermato e cosa cambia per chi oggi manda avanti un workflow di sicurezza basato su Claude.
Cosa è stato davvero rilasciato
Tre cose, in un unico drop.
- GPT-5.6-Cyber condivide la base di Sol, ma è stato addestrato specificamente per carichi di lavoro di cybersecurity: trovare vulnerabilità in codice reale, concatenare primitive in exploit funzionanti, sviluppare tecniche di privilege escalation e bypass di autenticazione, analizzare malware catturato. Non è un modello più grande. È Sol con un focus di training più stretto e confini di rifiuto diversi.
- Daybreak era il programma di 'accesso fiduciario' preesistente di OpenAI per il lavoro di cybersecurity. Il 10 agosto si è spaccato in Daybreak Blue e Daybreak Red. Blue dà accesso a Sol e ad altri modelli di frontiera generalisti con guardrail ritarati per il lavoro cyber difensivo (meno rifiuti sbagliati su richieste blue-team legittime, stessi rifiuti sull'offense). Red dà accesso a GPT-5.6-Cyber stesso, ed è riservato a ricerca offensiva verificata — red team, sviluppatori di exploit, discovery di vulnerabilità.
- OpenAI non ha rilasciato GPT-5.6-Cyber all'API per chiunque abbia una carta. I partner di lancio nominati includono Accenture, Capgemini, Cisco, Cloudflare, CrowdStrike, EY, Fortinet, IBM, KPMG, Palo Alto Networks, PwC e Sophos, più case finance come JPMorgan e Goldman Sachs. I clienti di quei partner ricevono l'*output* del lavoro fatto con GPT-5.6-Cyber — non ricevono il modello. Non esiste una via API per rivenditori.
Il 95%, letto onestamente
È la cifra più citata. Non è sbagliata, ma è molto più stretta di quanto suggeriscano i titoli.
Cos'è. Il benchmark interno di OpenAI "Advanced Cybersecurity Completion Rate" misura quanto spesso il modello produce un tentativo sostanziale di risposta su un set di prompt di exploit-chain / priv-esc / auth-bypass — prompt che un modello di frontiera normale rifiuta. Su quel set:
| Configurazione | Tasso di completamento |
|---|---|
| GPT-5.6 Sol (pubblico) | 1,5% |
| Sol via Daybreak Blue | 2,0% |
| GPT-5.5-Cyber (versione precedente) | 57,3% |
| GPT-5.6-Cyber (Daybreak Red) | 95,0% |
Cosa non è. Non è un "95% di scoperta zero-day" e non è la pretesa che il 95% dei tentativi di exploit funzioni. Ogni analisi seria nota che il benchmark misura la disponibilità del modello a rispondere più la plausibilità del contenuto prodotto — non il successo end-to-end di un exploit contro target induriti. La stessa system card di GPT-5.6 di OpenAI classifica la famiglia come High sull'asse Cybersecurity del Preparedness Framework, esplicitamente non Critical, perché Sol e Terra riescono a trovare componenti di exploit ma non sono riusciti a condurre attacchi autonomi end-to-end su sistemi induriti. Cyber ha la stessa base — un cambio di disponibilità, non di soffitto.
- Il 95% è un numero interno, pubblicato da OpenAI. Al momento della pubblicazione, nessun laboratorio indipendente ha rilasciato una riproduzione e OpenAI non ha reso disponibile il set del benchmark. Trattate il delta (Sol → Cyber) come evidenza direzionale di un cambio nella policy di rifiuto, non come misura dell'efficacia degli exploit.
- La classificazione Preparedness (High, non Critical) è il soffitto onesto. Se Sol non può compromettere autonomamente end-to-end un target indurito, Cyber-sopra-Sol nemmeno. Il valore sta nell'*ampiezza delle cose che farà senza rifiutare* — non in un salto di capacità.
La debolezza controintuitiva: peggio di Sol sui report aperti
Questo è il fatto che gran parte della copertura di lancio ha saltato, ed è la singola informazione più utile per chi lavora sul campo. Le release note di OpenAI descrivono GPT-5.6-Cyber come produttore di output più corti e meno dettagliati rispetto a Sol nei task di vulnerability report aperti — il tipo di prompt "guarda questo codice e scrivimi tutto quello che c'è di sbagliato" che domina il lavoro difensivo reale. Cyber è ottimizzato per richieste strette e in forma d'azione ("scrivi l'exploit"), e paga il conto sull'output analitico esteso.
La regola pratica che ne segue:
- Usa GPT-5.6-Cyber quando il task è stretto e in forma offensiva: "dato questo primitivo di heap overflow, concatena fino a RCE"; "genera un payload di auth-bypass per questo endpoint dato il comportamento osservato".
- Resta su Sol (via Daybreak Blue) quando il task è analitico e aperto: "esamina questo diff da 3.000 LOC per problemi di sicurezza"; "scrivimi un postmortem completo di questo incident"; "riassumi il panorama di sfruttamento per CVE-2026-XXXXX".
Se schieri Cyber per tutto, otterrai un output difensivo peggiore di una pipeline plain-Sol. Questo è un tradeoff reale, non marketing.
I controlli di accesso (non sono facciata)
Il gate di Daybreak Red è il più stretto di qualsiasi LLM commerciale generalista fino ad oggi. In pratica, chi fa richiesta deve superare tutto quanto segue:
- Non solo il titolare dell'account — ogni essere umano che manderà un prompt va identificato. Applicabile a ricercatori individuali (via la pagina cyber di ChatGPT), organizzazioni (via il modulo di accesso enterprise) e partner (via il Daybreak Cyber Partner Program).
- Il TOTP è in regime transitorio solo fino al 1° settembre. Dopo quella data ogni account Daybreak deve presentare una chiave hardware WebAuthn / FIDO2 al sign-in. Gli utenti esistenti con TOTP devono procurarsi e registrare chiavi prima della scadenza o perdono l'accesso.
- Attesti, per ogni ingaggio, che il lavoro è autorizzato e dentro uno scope definito. Non è un semplice click-through: fa riferimento a sistemi target nominati e a clienti autorizzanti nominati. È il livello che permette a OpenAI di spegnere velocemente singoli account se una dichiarazione di scope risulta falsa.
- Il traffico GPT-5.6-Cyber passa attraverso gli stessi 'activation classifier aggiunti di recente' che la system card di GPT-5.6 descrive per Sol e Terra, più una scansione post-generazione che blocca classi specifiche di output. OpenAI dichiara di bloccare 'circa dieci volte più attività potenzialmente dannosa' rispetto alla generazione precedente di safeguard. Cyber non disabilita questo livello — abbassa la soglia di rifiuto che sta *prima*.
- Se la tua organizzazione compra servizi basati su GPT-5.6-Cyber da CrowdStrike, Palo Alto o IBM, ricevi l'*output*. Non ricevi una chiave API. È deliberato: l'accesso al modello resta al partner approvato, che si prende in carico KYC e attestazioni di scope per ogni prompt. Oggi non esiste una via perché un red team di media dimensione trasferisca un workflow GPT-5.6-Cyber dentro il proprio tooling — o vieni accettato in Daybreak Red direttamente, o consumi tramite un partner.
Perché OpenAI può sostenere che questo sia più sicuro
La lettura intuitiva è "OpenAI ha rimosso i guardrail sul suo modello più forte — è peggio per la sicurezza". La versione più forte della posizione di OpenAI è più sottile e vale la pena di capirla, che tu sia d'accordo o no:
- I modelli di frontiera possono già fare gran parte di questo. La disclosure di Anthropic sugli escapes delle cyber-eval — Claude Opus 4.7 e Mythos 5 che compromettono tre aziende reali dentro un ambiente red-team che si supponeva isolato — ha mostrato che un modello di frontiera con rifiuti standard, se gli dai tool e internet, troverà e sfrutterà debolezze reali senza training cyber-specialistico. L'intrusione agentica su Hugging Face di OpenAI ha detto la stessa cosa su un modello diverso. La capacità è già in circolazione.
- Ciò che Cyber cambia è chi ha accesso affidabile a quella capacità senza il gioco d'azzardo dei jailbreak. L'argomento di OpenAI è che i difensori e i loro consulenti dovrebbero essere quelli con un modo stabile e in-policy di usarla — non un cast rotante di jailbreaker sul web aperto.
- Il rischio opposto è quello che ogni storico degli strumenti dual-use ha già individuato: lo stesso modello a rifiuto abbassato che permette al red team di Cloudflare di iterare più in fretta permette a un dipendente compromesso dentro un partner Daybreak di fare lo stesso lavoro contro un target che il partner non ha mai autorizzato. I controlli (KYC, chiavi hardware, attestazioni di scope per prompt, activation classifier) esistono perché quel rischio è reale, non perché non lo sia.
Se la trovi persuasiva dipende meno dal modello e più da quanto ti fidi del programma.
Incrociando i numeri sulle patch generate dall'AI
Un numero che vale la pena appaiare al tasso di completamento del 95% è la debolezza continua delle patch generate dall'AI. Il pezzo di The Hacker News su GPT-5.6-Cyber cita ricerche che mostrano come le fix generate dall'AI risolvano completamente le vulnerabilità solo il 26,0% delle volte, con il 53,9% che introduce nuove vulnerabilità. Quell'asimmetria — offense che sopravanza di gran lunga la difesa autonoma — è l'argomento strutturale più forte per cui "basta lasciare che l'AI dei difensori le prenda al volo" non è una risposta completa a "stiamo rilasciando un modello di tier offensivo".
Se stai dal lato difensivo, la lettura pratica è: usa GPT-5.6-Cyber (o Claude, o qualsiasi modello forte) per trovare problemi, poi usa un umano + test riproducibili per risolverli. Non concatenare la patch del modello dritta dentro una PR. Ogni pipeline riproducibile che costruisci dovrebbe assumere che lo step di generazione della patch sia un lancio di monetina.
Cosa cambia davvero per un workflow cyber basato su Claude
Anthropic non ha rilasciato un tier equivalente "offense-grade". Opus 5, Sonnet 5 e Mythos 5 mantengono tutti la posizione di rifiuto standard sullo stesso set di prompt. Restano tre situazioni pratiche:
- Il lancio di Cyber non libera Opus 5 — Anthropic non ha cambiato la sua postura di rifiuto. Ma cambia la *baseline di aspettativa*. I red team peer che entrano in Daybreak Red itereranno più in fretta su task offensivi stretti. Assumi che i competitor sull'offense abbiano quello speedup; pianifica di conseguenza, non provare a pareggiarlo facendo jailbreak di Opus.
- Qui hai parità o un vantaggio. Sonnet 5 / Opus 5 sono forti sul lavoro di review lungo e aperto su cui GPT-5.6-Cyber è esplicitamente peggio. Se una shop Daybreak-Blue prova a sostituire con Cyber per la review difensiva, otterranno output più corti e più magri. Il tuo workflow non è obsoleto.
- Adesso hai due strade: fare domanda a Daybreak Red direttamente (KYC, chiavi hardware, attestazioni di scope per ingaggio, nessun rivenditore facile), o costruire sopra a modelli open-weight (vedi [DeepSeek / Qwen open models](/docs/models/deepseek-qwen-open-models) e [GLM 5.2](/docs/models/glm-5-2-open-weight-frontier)) dove la posizione di rifiuto è sotto il tuo controllo. Entrambe sono percorribili. Nessuna delle due è 'chiave API e via' come lo sono GPT-5.6 generalista o Claude.
Due prompt che si comportano in modo completamente diverso attraverso i tier
Stesso prompt, tre endpoint diversi. Ecco com'è davvero lo split dei tier al livello della richiesta.
Una richiesta offensiva stretta
Given this authentication middleware code (Node.js/Express, JWT-based), enumerate concrete bypass techniques an attacker could use if the JWT secret is a low-entropy string. Include a working proof-of-concept exploit payload for each. // [code snippet omitted for this doc]
- GPT-5.6 Sol (API pubblica) — rifiuta; suggerisce invece un framing difensivo.
- Sol via Daybreak Blue — rifiuto simile; il tier Blue stringe i guardrail difensivi, non sblocca l'offense.
- GPT-5.6-Cyber via Daybreak Red — lo completa. Enumera brute force su secret debole,
alg:none, key confusion, e produce payload PoC. È il tipo di prompt che il delta 95%-vs-1,5% sta misurando.
Una review difensiva aperta
Here is a 2,400-line diff from our authentication service (JWT, session store, and rate limiter changes). Review it for security issues. Rank each finding by exploitability and impact. Include a suggested test that would catch a regression of each finding. // [diff omitted for this doc]
- GPT-5.6 Sol — lo completa per intero; produce un output lungo e strutturato.
- Sol via Daybreak Blue — uguale, forse leggermente più disposto a speculare su edge case.
- GPT-5.6-Cyber via Daybreak Red — lo completa, ma più corto e meno dettagliato nel framing analitico. È il comportamento "peggio di Sol sui task aperti" che OpenAI documenta. Usa il tier sbagliato qui e perdi segnale.
Fatti non ovvi da ricordare
- Il tasso di completamento del 95% è un delta di policy, non di capacità. GPT-5.6-Cyber sta sopra a Sol. Il soffitto di ragionamento sottostante è lo stesso.
- Classificazione Preparedness Framework: High, non Critical. Né Sol né Cyber conducono compromissione autonoma end-to-end di target induriti secondo la valutazione stessa di OpenAI. Chi ti sta vendendo "AI offensiva autonoma" sta esagerando.
- GPT-5.6-Cyber è peggio di Sol sui report aperti. Vittoria stretta, sconfitta ampia. Instrada per forma del task.
- Le chiavi hardware sono obbligatorie dal 1° settembre 2026. Se oggi sei su Daybreak con TOTP, è una scadenza reale. Ordina le chiavi ora, non a fine agosto.
- Non esiste una via per rivenditori. Consumare output basati su Cyber da un partner ≠ ottenere Cyber. Pianifica di conseguenza se ti aspettavi un'API a valle.
- Le CVE nominate nella copertura — una falla V8 di Chrome tracciata come CVE-2026-15903, più una catena di privilege escalation su mobile OS non nominata — sono le vetrine scelte dal vendor. La riproduzione indipendente della pretesa di "scoperta" non è ancora pubblica.
- I numeri 26% / 53,9% sulle patch AI (completamente risolte / nuove vulnerabilità introdotte) sono il contro-argomento strutturale più forte al "il tier offensivo va bene perché tanto l'AI dei difensori le prende". Il detection sopravanza le patch autonome di molto.
Guida rapida alla decisione
| Sei… | Usa questo |
|---|---|
| Un ricercatore che vuole provare prompt in forma offensiva, individualmente | Fai domanda a Daybreak Red via la pagina cyber di ChatGPT. Preparati a KYC, procurement delle chiavi hardware e attestazioni di scope. |
| Un'organizzazione che fa analisi blue-team e review lunghe | Daybreak Blue (Sol) o Claude Sonnet/Opus 5. Cyber è lo strumento sbagliato qui — più stretto e meno dettagliato. |
| Una società red-team che vuole integrare il modello nel tooling | Domanda diretta a Daybreak Red — l'accesso partner non si rivende. Se rifiutata, costruisci su open-weight (vedi pagine linkate) invece di fare jailbreak. |
| Un difensore preoccupato dal lato offensivo | Assumi uplift avversario su task stretti; il delta sulla compromissione end-to-end di sistemi induriti è piccolo (Preparedness: High, non Critical). Investi in verifica e test riproducibili, non nell'inseguire l'offense in velocità. |
Check yourself
0/5Fonti e approfondimenti
- OpenAI Deployment Safety Hub — GPT-5.6 system card — la classificazione preparedness ufficiale (High, non Critical), il livello degli activation classifier e la dichiarazione esplicita che Sol / Terra "non sono riusciti a condurre attacchi autonomi end-to-end".
- SecurityWeek — OpenAI Unveils New Cybersecurity Model GPT-5.6-Cyber — il riassunto più chiaro in una singola pagina del lancio, della struttura dei tier e della lista partner nominata.
- The Hacker News — OpenAI Launches GPT-5.6-Cyber with Reduced Safeguards for Exploit Development — scompatta la cifra del 95%, evidenzia il caveat "peggio di Sol sui report aperti" e cita i numeri 26% / 53,9% sulle patch AI.
- Forbes — OpenAI Ships GPT-5.6-Cyber, Its First 'Offense-Grade' Hacking Model (Jon Markman, 2026-08-11) — il framing "offense-grade", la CVE nominata (CVE-2026-15903) e la scadenza per le chiavi hardware.
- Cryptonomist — OpenAI cybersecurity program hits 95% zero-day detection with GPT-5.6-Cyber — utile come esempio ammonitore: il framing "zero-day detection" che usa qui è esattamente la sovrainterpretazione da evitare.
- Dataconomy — OpenAI Expands Daybreak With New GPT-5.6-Cyber Model — split Daybreak Blue vs Red, semantica dei tier.
- eesel AI — GPT-5.6-Cyber: what it is and who can actually get it — i tre percorsi di domanda (individuale / organizzazione / partner) e lo split partner-cliente.
- Quartz — OpenAI expands Daybreak cybersecurity program, launches GPT-5.6-Cyber — contesto ulteriore sui partner e sul framing dei tier.
- Su AILmanac: Aggiornamento di agosto 2026 a GPT-5.6 — slider di effort, Fast mode, cliff prezzi 272K · Anatomia degli escape delle cyber-eval di Anthropic · Anatomia dell'intrusione agentica su Hugging Face · Modelli open DeepSeek / Qwen · GLM 5.2, frontiera open-weight · Hardening delle esecuzioni autonome · Agenti di coding sotto attacco.