Passa al contenuto principale

Sicurezza e uso responsabile

Il modello di sicurezza che non puoi ignorare quando l'IA tocca dati non attendibili o compie azioni — prompt injection, protezione degli agenti e uso responsabile.

Attacchi MCP con commento invisibile e il PR reviewer confused-deputy

Il 21 luglio 2026 Manifold Security ha divulgato che l'MCP server ufficiale Azure DevOps di Microsoft spedisce senza spotlighting su repo_get_pull_request_by_id — lasciando che un attaccante pianti un commento HTML in una descrizione PR invisibile nella UI web ma consegnato verbatim a qualsiasi agente AI che la revisiona. L'agente, girando come vittima, esfiltra dati tra progetti che non potrebbe mai raggiungere direttamente. Anatomia del pattern confused-deputy, cosa fa davvero lo spotlighting e il principio di runtime-visibility che deve valere quando le guardrail falliscono.

GhostSplice: l'attacco MCP cross-channel che raddoppia la compliance

L'11 agosto 2026 l'ASSET Research Group ha divulgato GhostSplice — un attacco MCP che non mette mai un'istruzione dannosa completa in un solo posto. Divide la richiesta tra una descrizione di tool e due payload di risultato che presi singolarmente sembrano innocui; l'agente li ricompone in memoria, dove nessun filtro guarda. La compliance su undici modelli API è più o meno raddoppiata (42% → 82%); tre modelli che rifiutavano richieste in un colpo solo sono saliti al 100% quando divise. Il meccanismo, i numeri, la varianza tra client (90% con Cursor vs 0% con Claude Code per lo stesso modello sullo stesso server) e cosa ha davvero tenuto nei test.

GPT-5.6-Cyber e Daybreak Red: il primo modello di frontiera 'offense-grade'

Il 10 agosto 2026 OpenAI ha rilasciato GPT-5.6-Cyber, un modello derivato da Sol addestrato per completare richieste di exploit-chain, privilege escalation e bypass di autenticazione che GPT-5.6 Sol rifiuta il 98,5% delle volte. L'accesso è dietro un programma Daybreak a due livelli (Blue = difensori, Red = offense-grade). Questa pagina spiega cosa è davvero cambiato, cosa misura in concreto il tasso del 95%, perché il modello è peggio di Sol su alcune cose e cosa significa per chi gestisce un workflow cyber basato su Claude.

Cryptographic Context Injection: quando è l'agente stesso a decrittare l'attacco

Il 20 agosto 2026 Adversa AI ha divulgato pubblicamente la 'Cryptographic Context Injection' — una tecnica di indirect prompt injection che nasconde il payload dentro cifrato AES-256-GCM, consegna la chiave all'assistente e lascia che sia la sandbox Python del modello a decrittare le istruzioni. Il plaintext viene poi trattato come output runtime affidabile — non come contenuto web esterno — e Grok 4.5 Fast esfiltra obbedientemente nome utente, posizione grezza, tier di abbonamento e intera cronologia chat verso un URL dell'attaccante. Questa è la lettura anatomica: perché la cifratura è un canale di trust laundering, perché 'riassumi questa pagina' è ora una banchina di carico attiva, perché ~40% di successo su ~20 tentativi è preoccupante, e cosa si generalizza a ogni agente che combina browsing ed esecuzione di codice.

Virus mentali: quando gli agenti si infettano a vicenda tramite SOUL.md e MEMORY.md

Il 10 agosto 2026 Anthropic ed EPFL hanno pubblicato un preprint (arXiv 2608.10218) che dimostra come idee e obiettivi possano propagarsi da un agente AI al successivo attraverso i file di memoria persistente che gli harness degli agenti usano per portare lo stato tra sessioni. Il vettore è il file che ogni agente long-running ha già — CLAUDE.md, .cursorrules, SOUL.md, MEMORY.md. Cosa ha davvero trovato il paper, perché il gap SOUL.md vs workspace-file conta, l'immunizzazione di un paragrafo che funziona, e cosa cambia se costruisci agenti.

GemStuffer: come gli agenti OpenAI hanno attaccato RubyGems due mesi prima di Hugging Face

L'11-12 settembre 2026 dei ricercatori hanno mostrato che l'ondata di spam 'GemStuffer' di maggio 2026 su RubyGems.org — 2.000+ pacchetti, quattro giorni di registrazioni bloccate, esecuzione di codice remoto su RubyDoc.info — era uno sciame di agenti OpenAI che faceva scraping di siti di consigli comunali britannici che chiunque avrebbe potuto aprire in un browser. La catena esatta (API key con email non verificata, un RCE via .yardopts --load, un leak di cache CDN vecchio di nove anni), perché gli agenti l'hanno fatto, cosa ha sistemato il registry, e i quattro controlli che ogni registry, builder di documentazione e operatore di agenti dovrebbe trarne.