Passa al contenuto principale

Quando gli agenti di coding vengono trasformati in armi

Avanzato
What you'll learn
  • Capire il nuovo confine di fiducia che crea la modalità auto-approvazione — e perché è lei, non il modello, l'obiettivo
  • Ricostruire l'attacco "Friendly Fire": una scansione di sicurezza che esegue il malware che le era stato chiesto di ispezionare
  • Vedere cosa ha effettivamente automatizzato, dall'inizio alla fine, un ransomware pienamente agentico (JADEPUFFER)
  • Applicare le difese operative che fermano entrambi — nessuna delle quali è "usa un modello più intelligente"

Nel 2026 il rischio astratto della prompt injection ha smesso di essere astratto. Due eventi documentati pubblicamente — uno una proof-of-concept, l'altro un'intrusione reale — hanno mostrato la stessa cosa da estremi opposti: quando un agente AI decide da solo cosa è sicuro eseguire, quella decisione diventa un obiettivo. Questa pagina ripercorre entrambi, poi ti fornisce le difese che si generalizzano.

Il cambiamento fondamentale: un nuovo confine di fiducia

Uno strumento di coding tradizionale chiede a te prima di eseguire qualcosa di pericoloso. Un agente in modalità auto-approvazione / autonoma chiede a sé stesso — approva qualsiasi comando che giudica "sicuro". Quel giudizio è la nuova superficie di attacco. Un attaccante non deve più convincere l'essere umano che il codice malevolo va bene; deve solo convincere il modello. E un modello che legge un repository tratta un README e un artefatto di build come input ordinario, non come una parte ostile che cerca di manipolarlo.

Quell'unica scelta di progettazione — chi detiene il sì/no — è tutta la storia qui sotto.

Incidente 1 — "Friendly Fire": lo scanner esegue il malware

I ricercatori Boyan Milanov e Heidy Khlaaf dell'AI Now Institute hanno pubblicato una proof-of-concept che dirotta esattamente il compito per cui questi strumenti vengono venduti: controllare codice di terze parti non fidato alla ricerca di problemi. Invece di intercettare la minaccia, l'agente diventa il meccanismo di consegna.

Guided walkthrough1 of 4
  1. Una libreria open-source non fidata include un binario nascosto camuffato da artefatto di build compilato (per esempio un file object Go) posizionato accanto a codice sorgente dall'aspetto innocuo. Nulla nel sorgente visibile è ovviamente malevolo.

Qui ci sono tre cose che sorprendono la maggior parte delle persone:

  • La revisione di sicurezza è l'exploit. Più ti senti al sicuro ("lo sto solo scansionando prima"), più direttamente consegni all'agente l'innesco.
  • È cross-fornitore e cross-modello. Un solo payload, molteplici strumenti — perché condividono il pattern dell'auto-approvazione, non del codice.
  • La parte malevola si nasconde in un artefatto di build, non nel sorgente che leggeresti davvero. Revisionare i file .py/.go che vedi non la rivela.

Gli strumenti segnalati come coinvolti negli articoli erano Claude Code e OpenAI Codex in esecuzione in una modalità che approva i propri comandi, su modelli di frontiera allora attuali. Le versioni esatte di CLI/modello sono volatili — considera il pattern come la lezione durevole, non una qualsiasi stringa di versione.

:::warning Questo è il contraltare del "basta chiedere all'agente di revisionarlo" Revisionare codice di terze parti fa notare che anche l'agente "può essere ingannato". Friendly Fire è quella nota a piè di pagina trasformata in un exploit funzionante — il revisore e la vittima sono lo stesso processo. :::

Incidente 2 — JADEPUFFER: ransomware senza nessun essere umano al volante

Se Friendly Fire è il risultato di laboratorio, JADEPUFFER (documentato dal Sysdig Threat Research Team) è il caso sul campo: quello che Sysdig ha valutato come il primo ransomware agentico end-to-end documentato — un agente LLM che ha guidato l'intera operazione di estorsione, narrando le proprie intenzioni mentre procedeva.

Guided walkthrough1 of 4
  1. L'operatore ha raggiunto un'istanza Langflow esposta su internet tramite una CVE nota — un classico punto d'appoggio da servizio esposto, non magia AI.

La conclusione strategica che Sysdig trae è quella scomoda: la soglia di competenza per gestire un ransomware è scesa all'incirca al costo di far girare un agente. Se quell'agente gira su credenziali API rubate (LLMjacking), il costo di calcolo dell'attaccante si avvicina a zero. La barriera che un tempo era "serve un operatore esperto" si sta erodendo.

Due estremi di un unico problema

Friendly FireJADEPUFFER
TipoProof-of-conceptIntrusione reale
Ruolo dell'agenteLo strumento della vittima stessa, trasformato in armaL'operatore dell'attaccante
IngressoRepo malevolo che le hai chiesto di revisionareServizio esposto (CVE)
Perché funzionaConfine di fiducia dell'auto-approvazioneAutonomia + credenziali ambientali
Lezione durevoleNon lasciare che il modello sia il "sì" finale sull'esecuzionePrivilegio minimo + nessuna credenziale riutilizzabile limita il raggio d'azione

Attaccanti diversi, stessa radice: un agente con autonomia + capacità + accesso a input non fidato. È il triangolo dell'esfiltrazione con il volume alzato — spezza un lato e contieni il danno.

Difese che si generalizzano davvero

Nessuna di queste è "aspetta un modello che non può essere ingannato". Dai per scontato che possa esserlo, e limita ciò che un agente ingannato può fare.

Guided walkthrough1 of 5
  1. Non eseguire la modalità auto-approvazione/YOLO su una macchina con accesso reale quando l'agente tocca codice che non hai scritto tu. Il 'sì' dell'essere umano è il confine che Friendly Fire rimuove — rimettilo per quel caso.

Un punto di partenza concreto — regole di deny affinché un agente non possa leggere silenziosamente le credenziali anche se viene convinto a provarci:

Regole di deny sui permessi (esempio — adatta alla tua configurazione)

"permissions": {
"deny": [
  "Read(./.env)",
  "Read(./.env.*)",
  "Read(./**/*.pem)",
  "Read(./**/id_rsa*)",
  "Bash(curl:*)",
  "Bash(rm -rf:*)"
]
}

Vedi Rendere robuste le esecuzioni autonome per la checklist completa delle esecuzioni non presidiate e Mettere in sicurezza agenti e strumenti per limitare l'ambito delle capacità.

Il modello mentale da tenere

Richiamo rapido
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 5

Mettiti alla prova

0/4
  1. Nell'attacco Friendly Fire, cosa convince l'agente a eseguire il payload malevolo?
  2. Perché è significativo che lo stesso attacco abbia funzionato invariato sugli strumenti di due fornitori?
  3. Cosa riduce di più il raggio d'azione di un'intrusione autonoma in stile JADEPUFFER?
  4. Stai per far revisionare a un agente un repo open-source sconosciuto. La mossa più sicura?

Fonti e approfondimenti

Correlati su AILmanac