Watermark del testo AI: cosa rileva davvero SynthID-Text (e cosa no)
Il 14 agosto 2026 Anthropic ha pubblicato una FAQ completa su come Claude ora stampa una firma statistica invisibile nel testo che produce. Non è il primo — Google ha spedito SynthID-Text per Gemini nel 2024, e nella stessa settimana in cui è comparso il post di Anthropic, altri provider di frontiera stavano attivando silenziosamente la stessa feature. La forcing function non è il marketing. È l'Articolo 50 dell'EU AI Act, i cui obblighi di trasparenza per l'AI generativa sono diventati pienamente applicabili il 2 agosto 2026 — ogni provider che serve l'UE ora deve marcare i contenuti generati dall'AI in modo rilevabile dalle macchine.
La copertura del lancio ha detto soprattutto "il testo AI adesso ha i watermark". È la cosa meno interessante. Questa lezione riguarda il meccanismo: come è incorporato il watermark, cosa restituisce davvero un rilevatore, i quattro modi in cui sparisce silenziosamente e cosa ti dice realmente "watermark rilevato".
- Spiegare il meccanismo di SynthID-Text — come una chiave segreta influenza la selezione dei token senza cambiare ciò che il modello può dire
- Prevedere quando il rilevamento funzionerà o meno: lunghezza del passaggio, prosa fattuale vs creativa, codice, traduzione, revisione
- Leggere correttamente l'output di un rilevatore di watermark — restituisce un punteggio di probabilità, non un verdetto sì/no
- Elencare le quattro operazioni comuni che cancellano il watermark e l'unica che lo lascia completamente intatto
- Comprendere la regola dell'Articolo 50 dell'EU AI Act che ha imposto il watermarking del testo dal vivo su tutti i provider il 2 agosto 2026
L'idea di fondo: influenza il lancio della moneta, non cambiare le parole
Un LLM genera testo un token alla volta. Ad ogni passo produce una distribuzione di probabilità sul vocabolario — spesso migliaia di token candidati con probabilità non triviale — e campiona da essa. Quando scrivi "il tempo era", il modello può pesare soleggiato, nuvoloso, grigio, mite, fresco come scelte grosso modo equivalenti; il campionamento ne sceglie uno. Quel lancio finale di moneta usa normalmente una sorgente casuale arbitraria.
Un watermark sostituisce la sorgente casuale con una deterministica derivata da una chiave segreta e da una breve finestra dei token appena precedenti. Il vocabolario non è cambiato, le probabilità non sono cambiate e nessuna parola specifica è forzata. Ciò che cambia è quale delle opzioni ugualmente plausibili tende a essere scelta. Come dice Anthropic: non è che il modello diventi orientato verso nuvoloso o grigio in generale — nuvoloso potrebbe essere selezionato in una frase, grigio in quella successiva. Ciò che si accumula su un passaggio abbastanza lungo è una correlazione statistica tra il contesto locale e il token scelto che un testo casuale semplicemente non può riprodurre. Quella correlazione è il watermark.
L'implementazione di Anthropic è una versione di SynthID-Text, lo schema che Google DeepMind ha pubblicato su Nature nel 2024 (vedi la panoramica di SynthID di Google DeepMind). Poiché il bias risiede dentro il campionamento e nudge solo fra token che il modello considerava già accettabili, la qualità nei benchmark standard è misurabilmente invariata — motivo per cui Google ha potuto attivarlo silenziosamente sul traffico Gemini senza che gli utenti se ne accorgessero.
- Per il token N+1 l'LLM calcola le probabilità sul vocabolario come farebbe sempre. Nessun re-training. Nessun filtro. Ecco perché la capacità del modello non è influenzata.
- Una chiave segreta combinata con una breve finestra di token appena prima della posizione N+1 semina una funzione che assegna a ogni token candidato un g-value pseudo-casuale. Stessa chiave + stesso contesto = sempre gli stessi punteggi.
- Il sampler è inclinato a preferire leggermente i candidati con g-value favorevoli, mantenendo la distribuzione di output vicina all'originale. Su una singola scelta è invisibile. Su molte scelte, pianta un pattern ripetibile.
- Dato il testo e la stessa chiave, il rilevatore calcola quali sarebbero stati i g-value in ogni posizione e misura quanto spesso i token osservati sono caduti su opzioni ad alto punteggio. Testo umano casuale ottiene un punteggio vicino al caso; testo con watermark ottiene un punteggio significativamente superiore.
Perché il meccanismo decide quando il rilevamento fallisce
I quattro modi comuni in cui il watermark sparisce non sono bug — derivano direttamente da ciò che l'algoritmo fa davvero.
Passaggi brevi. Il rilevamento è un test statistico. Poche frasi producono troppe poche scelte di token perché il segnale possa emergere dal rumore. Anthropic lo nota esplicitamente: "il rilevamento di un watermark non funziona bene su campioni piccoli, dove ci sono meno scelte di parole e quindi meno informazione su cui basarsi". In pratica: aspettati che un rilevamento affidabile richieda centinaia di token, non tweet.
Testo fattuale. Quando c'è essenzialmente un unico token successivo corretto — una data, un nome, una definizione, un identificatore di codice — il sampler non ha alternative accettabili tra cui scegliere, quindi il bias non ha dove attaccarsi. Anthropic: "il watermarking è più rado sui passaggi fattuali dove ci sono meno scelte che si possono fare senza ridurre l'accuratezza del testo". Un riassunto in stile Wikipedia di una pagina porterà meno segnale per parola rispetto alla stessa lunghezza di scrittura creativa.
Codice. Stessa ragione, più difficile. La sintassi di programmazione è in gran parte fissa; la flessibilità dei token vive per lo più negli identificatori e nei commenti. Anthropic riconosce che "il codice — che in moltissimi casi deve essere esatto — ha generalmente meno watermarking rispetto ad altre forme di testo". Considera i punteggi del rilevatore sul codice come di bassa confidenza.
Revisione e riscrittura. Quando Claude edita testo umano invece di generarlo, la maggior parte dei token sono quelli dell'utente; solo le modifiche portano il watermark. Una revisione leggera è essenzialmente invisibile. Sul rovescio della medaglia, passare testo con watermark attraverso un modello diverso, senza watermarking per parafrasarlo pesantemente rimuove il segnale perché un nuovo sampler ha prodotto i token.
Due cose che sorprendono, ma non dovrebbero:
- L'editing umano leggero sopravvive. Sostituire poche parole lascia intatta la maggior parte del segnale — il rilevatore aggrega un piccolo bias su migliaia di posizioni, non cerca frasi specifiche.
- La traduzione mantiene il watermark — perché una traduzione è una nuova generazione dove ogni token è scelto dal modello. È un diverso passaggio con watermark, non una copia diluita dell'originale.
Cosa restituisce davvero il rilevatore
La cosa più fraintesa sui watermark nella copertura mediatica: un rilevatore non produce "AI: sì / no". Produce un punteggio — essenzialmente "quanto oltre il caso cade il pattern dei token di questo testo per la nostra chiave?" — e una soglia trasforma quel punteggio in una decisione, con due tassi di errore che si compensano a vicenda.
- Un punteggio alto è evidenza bayesiana, non prova. Su un passaggio lungo e creativo può essere evidenza forte. Su uno breve o fattuale, lo stesso punteggio significa molto meno.
- Un risultato negativo non prova mai che il testo non sia stato generato dall'AI. Parafrasare, mescolare con scrittura umana o usare un modello senza watermarking sconfiggono tutti il rilevamento producendo testo di autoria AI.
- Il rilevatore ha bisogno della chiave segreta. Anthropic sta offrendo l'API di rilevamento a partner fidati; non esiste uno strumento pubblico 'è questo Claude?' che chiunque possa eseguire su testo arbitrario.
Il riassunto stesso di Anthropic sulla garanzia del rilevatore è calibrato esattamente così: dato un passaggio abbastanza lungo e la chiave giusta, "si può assegnare una probabilità che il testo sia stato generato da Claude". Probabilità. Non verdetto.
Il gatekeeping conta. La documentazione dell'API SynthID di Google è esplicita che il rilevatore è attualmente ad accesso limitato; Anthropic ha la stessa postura — l'accesso viene esteso per fasi a giornalisti, educatori e piattaforme con un legittimo bisogno di verifica. È deliberato: se il rilevatore fosse pubblico, gli avversari potrebbero modificare iterativamente il testo finché il punteggio non scende sotto soglia. L'accesso ristretto compra una certa robustezza.
Watermark vs C2PA vs classificatore — tre strumenti completamente diversi
Il discorso sulla provenienza confonde questi tre. Non sono la stessa cosa e non competono.
| Strumento | Il segnale risiede in | Richiede la cooperazione del generatore? | Sopravvive alla parafrasi? | Cosa ti dice |
|---|---|---|---|---|
| SynthID-Text / watermark statistico | Scelte di token dentro il testo | Sì (acceso al momento del campionamento) | Parziale — modifiche leggere sì, riscrittura pesante no | "Questo testo è stato generato da un modello che condivide questa chiave, con probabilità X." |
| C2PA / Content Credentials | Metadati firmati crittograficamente allegati al file | Sì (il firmatario include la credenziale) | No — banalmente rimossi copiando il testo fuori | "Questo file è stato pubblicato da questo firmatario con questa storia." Pensato per immagini/audio/video dove i metadati viaggiano insieme. |
| Classificatore di testo AI di terza parte (GPTZero, Pangram, ecc.) | Proprietà statistiche del testo stesso, nessuna chiave | No | Parziale — migliora man mano che i modelli lasciano stile rilevabile, ma combatte una corsa agli armamenti | "Questo testo sembra testo generato dall'AI, secondo il mio modello." Una stima, non una firma. |
La lezione: un watermark risponde a "il modello di questo specifico provider ha generato questo?" con il rilevatore del provider stesso. Un classificatore risponde a "sembra generato dall'AI in generale?" senza ground truth. C2PA risponde a "chi ha firmato questo file e qual è la sua storia di modifiche?" per i media dove esiste un wrapper di file.
Un prompt di disclosure più sicuro per pezzi scritti con l'AI
When you finish, add a footer: "AI assistance: Draft written by Claude (Anthropic). Edited by [name]. Substantive claims verified against cited sources." Then list any factual claim you couldn't verify from the sources I provided, so I can check or cut it before publishing.
Perché questo conta anche con i watermark attivi: un watermark più una riga di disclosure umana coprono entrambi i percorsi di verifica, automatico e umano. Un watermark da solo diventa una foglia di fico legale — tecnicamente conforme, inutile per un lettore che dà un'occhiata alla pagina.
La regola che ha forzato tutto questo: Articolo 50 dell'EU AI Act
L'annuncio del 14 agosto non è stato principalmente una decisione di prodotto. L'Articolo 50 dell'EU AI Act richiede ai provider di sistemi di AI generativa di marcare i loro output "in un formato leggibile dalle macchine e rilevabile come artificialmente generato o manipolato". L'AI Act è entrato in vigore il 1° agosto 2024; gli obblighi di trasparenza dell'Articolo 50 sono diventati pienamente applicabili il 2 agosto 2026. Questa è la scadenza contro cui ogni provider di frontiera si è preparato silenziosamente.
Il General-Purpose AI Code of Practice — il framework di conformità volontario che la Commissione europea ha pubblicato il 10 luglio 2025 — prende una posizione importante: nessuna tecnica di marcatura singola è sufficiente oggi. Raccomanda un approccio multi-livello che combini metadati (credenziali di contenuto in stile C2PA sui file) e watermarking intrecciato (bias in stile SynthID dentro il contenuto), insieme a logging e fingerprinting per identificare contenuti anche dopo che i marchi sono stati rimossi. Ecco perché vedrai i provider attivare tutti e tre insieme.
- L'Articolo 50 è provider-side. Obbliga il *provider* AI a marcare, e i deployer downstream a fare disclosure — non rende il watermarking prova in tribunale, e non ti impedisce di rimuovere il marchio dal tuo stesso testo. La conformità è su OpenAI/Anthropic/Google/Meta, non su di te come lettore.
- Il Code of Practice è volontario — ma i firmatari ottengono una presunzione di conformità con l'AI Act. I non firmatari possono comunque conformarsi con propri mezzi, ma affrontano richieste documentali più pesanti.
Cosa cambia nella pratica
Per quattro lettori diversi, quattro takeaway diversi:
- Assumi che qualsiasi cosa Claude, Gemini o il prossimo modello che usi scriverà porti un watermark di default. I passaggi creativi lunghi sono i più rilevabili; passaggi pesantemente editati o carichi di riferimenti, i meno. Fai disclosure diretta dell'assistenza AI invece di affidarti all'assenza di un watermark per nasconderla — un watermark è facile da sconfiggere, ma le aspettative etiche/di policy non si rilassano perché il rilevamento lo ha fatto.
- Preserva la provenienza che ricevi (credenziali di contenuto C2PA sui media caricati). Considera una policy che richieda la disclosure del testo generato dall'AI, e ricorda che gli attuali rilevatori di watermark danno probabilità — non verdetti — e non saranno affidabili sui post brevi.
- Nulla nel tuo codice cambia. Il watermarking avviene dentro il campionamento, a valle di qualsiasi prompt o decisione di tool use. Non aggiungere le tue proprie banner 'generato dall'AI' come sostituto di una buona disclosure UX. Pensa ai diritti dei tuoi utenti: se offri testo che sarà ripubblicato, una riga di disclosure opt-in è più amichevole che affidarsi a marchi invisibili.
- Quando l'accesso al rilevatore si aprirà, usalo come un segnale in una triangolazione — insieme a citazioni, coerenza delle fonti e storia dello scrittore stesso. Non trattare mai un punteggio positivo su un passaggio breve come prova, e non trattare mai un punteggio negativo da nessuna parte come prova di autoria umana. L'inquadramento giusto è l'evidenza bayesiana, non il verdetto.
Cosa potrebbe ancora cambiare
Due grandi domande aperte da guardare:
- Rilevamento cross-provider. Oggi ciascun provider ha la propria chiave e il proprio rilevatore. Un watermark di Claude non sarà flaggato dal rilevatore di Gemini, e viceversa. Il Code of Practice accenna a un'eventuale interoperabilità — per esempio, un campo di metadati pubblico che dice "questo contenuto era con watermark, chiedi a questo endpoint per verificare" — ma nulla di production-grade esiste ancora.
- Robustezza avversariale. La letteratura accademica sui watermark statistici (parti dal paper Kirchenbauer et al. 2023 che ha reso popolare l'approccio del g-value) mostra già diversi attacchi: parafrasi cross-model, sostituzione a livello di token e retro-traduzione degradano tutti il segnale. I provider lo sanno. Aspettati che gli schemi iterino — gli schemi di watermark diventeranno più robusti, gli attacchi terranno il passo e il valore informativo di un verdetto "rilevato" su testo modificato avversarialmente resterà limitato.
Check yourself
0/5Correlati su AILmanac
- Scelta di un Model Provider — dove le policy del provider (come watermarking, retention dei dati, tier di sicurezza) rientrano in una decisione di scelta.
- Privacy — come vengono gestiti gli output oltre i soli watermark: retention, uso per training e controlli enterprise.
- Allucinazioni — i watermark non ti dicono se il testo AI è vero, solo se è stato generato. La verifica è un lavoro separato.
- Media Generativi: Immagini, Audio, Video — la stessa domanda di provenienza, per le modalità dove C2PA fa la maggior parte del lavoro.
Fonti e approfondimenti
- Come funziona il watermarking del testo di Claude — Anthropic (14 ago 2026) — la FAQ primaria che questa pagina sintetizza.
- Panoramica SynthID — Google DeepMind — la famiglia di strumenti di watermarking di cui SynthID-Text fa parte.
- Documentazione delle safeguard SynthID Text — Google AI — come SynthID-Text è esposto come API, con note sull'accesso al rilevatore.
- Kirchenbauer et al., "A Watermark for Large Language Models" (2023) — il meccanismo g-value / red-list su cui sono costruiti gli schemi attuali.
- EU AI Act — riassunto Wikipedia dell'Articolo 50 e della data di applicazione del 2 agosto 2026 — il regolamento che ha forzato il watermarking sui provider.
- General-Purpose AI Code of Practice — Wikipedia — il framework volontario che raccomanda watermark + metadati + logging a strati.
- Coalition for Content Provenance and Authenticity (C2PA) — lo standard di provenienza dei media che complementa i watermark testuali.