Passa al contenuto principale

Watermark del testo AI: cosa rileva davvero SynthID-Text (e cosa no)

Intermedio

Il 14 agosto 2026 Anthropic ha pubblicato una FAQ completa su come Claude ora stampa una firma statistica invisibile nel testo che produce. Non è il primo — Google ha spedito SynthID-Text per Gemini nel 2024, e nella stessa settimana in cui è comparso il post di Anthropic, altri provider di frontiera stavano attivando silenziosamente la stessa feature. La forcing function non è il marketing. È l'Articolo 50 dell'EU AI Act, i cui obblighi di trasparenza per l'AI generativa sono diventati pienamente applicabili il 2 agosto 2026 — ogni provider che serve l'UE ora deve marcare i contenuti generati dall'AI in modo rilevabile dalle macchine.

La copertura del lancio ha detto soprattutto "il testo AI adesso ha i watermark". È la cosa meno interessante. Questa lezione riguarda il meccanismo: come è incorporato il watermark, cosa restituisce davvero un rilevatore, i quattro modi in cui sparisce silenziosamente e cosa ti dice realmente "watermark rilevato".

What you'll learn
  • Spiegare il meccanismo di SynthID-Text — come una chiave segreta influenza la selezione dei token senza cambiare ciò che il modello può dire
  • Prevedere quando il rilevamento funzionerà o meno: lunghezza del passaggio, prosa fattuale vs creativa, codice, traduzione, revisione
  • Leggere correttamente l'output di un rilevatore di watermark — restituisce un punteggio di probabilità, non un verdetto sì/no
  • Elencare le quattro operazioni comuni che cancellano il watermark e l'unica che lo lascia completamente intatto
  • Comprendere la regola dell'Articolo 50 dell'EU AI Act che ha imposto il watermarking del testo dal vivo su tutti i provider il 2 agosto 2026

L'idea di fondo: influenza il lancio della moneta, non cambiare le parole

Un LLM genera testo un token alla volta. Ad ogni passo produce una distribuzione di probabilità sul vocabolario — spesso migliaia di token candidati con probabilità non triviale — e campiona da essa. Quando scrivi "il tempo era", il modello può pesare soleggiato, nuvoloso, grigio, mite, fresco come scelte grosso modo equivalenti; il campionamento ne sceglie uno. Quel lancio finale di moneta usa normalmente una sorgente casuale arbitraria.

Un watermark sostituisce la sorgente casuale con una deterministica derivata da una chiave segreta e da una breve finestra dei token appena precedenti. Il vocabolario non è cambiato, le probabilità non sono cambiate e nessuna parola specifica è forzata. Ciò che cambia è quale delle opzioni ugualmente plausibili tende a essere scelta. Come dice Anthropic: non è che il modello diventi orientato verso nuvoloso o grigio in generale — nuvoloso potrebbe essere selezionato in una frase, grigio in quella successiva. Ciò che si accumula su un passaggio abbastanza lungo è una correlazione statistica tra il contesto locale e il token scelto che un testo casuale semplicemente non può riprodurre. Quella correlazione è il watermark.

L'implementazione di Anthropic è una versione di SynthID-Text, lo schema che Google DeepMind ha pubblicato su Nature nel 2024 (vedi la panoramica di SynthID di Google DeepMind). Poiché il bias risiede dentro il campionamento e nudge solo fra token che il modello considerava già accettabili, la qualità nei benchmark standard è misurabilmente invariata — motivo per cui Google ha potuto attivarlo silenziosamente sul traffico Gemini senza che gli utenti se ne accorgessero.

Guided walkthrough1 of 4
  1. Per il token N+1 l'LLM calcola le probabilità sul vocabolario come farebbe sempre. Nessun re-training. Nessun filtro. Ecco perché la capacità del modello non è influenzata.

Perché il meccanismo decide quando il rilevamento fallisce

I quattro modi comuni in cui il watermark sparisce non sono bug — derivano direttamente da ciò che l'algoritmo fa davvero.

Passaggi brevi. Il rilevamento è un test statistico. Poche frasi producono troppe poche scelte di token perché il segnale possa emergere dal rumore. Anthropic lo nota esplicitamente: "il rilevamento di un watermark non funziona bene su campioni piccoli, dove ci sono meno scelte di parole e quindi meno informazione su cui basarsi". In pratica: aspettati che un rilevamento affidabile richieda centinaia di token, non tweet.

Testo fattuale. Quando c'è essenzialmente un unico token successivo corretto — una data, un nome, una definizione, un identificatore di codice — il sampler non ha alternative accettabili tra cui scegliere, quindi il bias non ha dove attaccarsi. Anthropic: "il watermarking è più rado sui passaggi fattuali dove ci sono meno scelte che si possono fare senza ridurre l'accuratezza del testo". Un riassunto in stile Wikipedia di una pagina porterà meno segnale per parola rispetto alla stessa lunghezza di scrittura creativa.

Codice. Stessa ragione, più difficile. La sintassi di programmazione è in gran parte fissa; la flessibilità dei token vive per lo più negli identificatori e nei commenti. Anthropic riconosce che "il codice — che in moltissimi casi deve essere esatto — ha generalmente meno watermarking rispetto ad altre forme di testo". Considera i punteggi del rilevatore sul codice come di bassa confidenza.

Revisione e riscrittura. Quando Claude edita testo umano invece di generarlo, la maggior parte dei token sono quelli dell'utente; solo le modifiche portano il watermark. Una revisione leggera è essenzialmente invisibile. Sul rovescio della medaglia, passare testo con watermark attraverso un modello diverso, senza watermarking per parafrasarlo pesantemente rimuove il segnale perché un nuovo sampler ha prodotto i token.

Due cose che sorprendono, ma non dovrebbero:

  • L'editing umano leggero sopravvive. Sostituire poche parole lascia intatta la maggior parte del segnale — il rilevatore aggrega un piccolo bias su migliaia di posizioni, non cerca frasi specifiche.
  • La traduzione mantiene il watermark — perché una traduzione è una nuova generazione dove ogni token è scelto dal modello. È un diverso passaggio con watermark, non una copia diluita dell'originale.

Cosa restituisce davvero il rilevatore

La cosa più fraintesa sui watermark nella copertura mediatica: un rilevatore non produce "AI: sì / no". Produce un punteggio — essenzialmente "quanto oltre il caso cade il pattern dei token di questo testo per la nostra chiave?" — e una soglia trasforma quel punteggio in una decisione, con due tassi di errore che si compensano a vicenda.

Watch out
  • Un punteggio alto è evidenza bayesiana, non prova. Su un passaggio lungo e creativo può essere evidenza forte. Su uno breve o fattuale, lo stesso punteggio significa molto meno.
  • Un risultato negativo non prova mai che il testo non sia stato generato dall'AI. Parafrasare, mescolare con scrittura umana o usare un modello senza watermarking sconfiggono tutti il rilevamento producendo testo di autoria AI.
  • Il rilevatore ha bisogno della chiave segreta. Anthropic sta offrendo l'API di rilevamento a partner fidati; non esiste uno strumento pubblico 'è questo Claude?' che chiunque possa eseguire su testo arbitrario.

Il riassunto stesso di Anthropic sulla garanzia del rilevatore è calibrato esattamente così: dato un passaggio abbastanza lungo e la chiave giusta, "si può assegnare una probabilità che il testo sia stato generato da Claude". Probabilità. Non verdetto.

Il gatekeeping conta. La documentazione dell'API SynthID di Google è esplicita che il rilevatore è attualmente ad accesso limitato; Anthropic ha la stessa postura — l'accesso viene esteso per fasi a giornalisti, educatori e piattaforme con un legittimo bisogno di verifica. È deliberato: se il rilevatore fosse pubblico, gli avversari potrebbero modificare iterativamente il testo finché il punteggio non scende sotto soglia. L'accesso ristretto compra una certa robustezza.

Watermark vs C2PA vs classificatore — tre strumenti completamente diversi

Il discorso sulla provenienza confonde questi tre. Non sono la stessa cosa e non competono.

StrumentoIl segnale risiede inRichiede la cooperazione del generatore?Sopravvive alla parafrasi?Cosa ti dice
SynthID-Text / watermark statisticoScelte di token dentro il testoSì (acceso al momento del campionamento)Parziale — modifiche leggere sì, riscrittura pesante no"Questo testo è stato generato da un modello che condivide questa chiave, con probabilità X."
C2PA / Content CredentialsMetadati firmati crittograficamente allegati al fileSì (il firmatario include la credenziale)No — banalmente rimossi copiando il testo fuori"Questo file è stato pubblicato da questo firmatario con questa storia." Pensato per immagini/audio/video dove i metadati viaggiano insieme.
Classificatore di testo AI di terza parte (GPTZero, Pangram, ecc.)Proprietà statistiche del testo stesso, nessuna chiaveNoParziale — migliora man mano che i modelli lasciano stile rilevabile, ma combatte una corsa agli armamenti"Questo testo sembra testo generato dall'AI, secondo il mio modello." Una stima, non una firma.

La lezione: un watermark risponde a "il modello di questo specifico provider ha generato questo?" con il rilevatore del provider stesso. Un classificatore risponde a "sembra generato dall'AI in generale?" senza ground truth. C2PA risponde a "chi ha firmato questo file e qual è la sua storia di modifiche?" per i media dove esiste un wrapper di file.

Un prompt di disclosure più sicuro per pezzi scritti con l'AI

When you finish, add a footer:
"AI assistance: Draft written by Claude (Anthropic). Edited by [name]. Substantive claims verified against cited sources."

Then list any factual claim you couldn't verify from the sources I provided,
so I can check or cut it before publishing.

Perché questo conta anche con i watermark attivi: un watermark più una riga di disclosure umana coprono entrambi i percorsi di verifica, automatico e umano. Un watermark da solo diventa una foglia di fico legale — tecnicamente conforme, inutile per un lettore che dà un'occhiata alla pagina.

La regola che ha forzato tutto questo: Articolo 50 dell'EU AI Act

L'annuncio del 14 agosto non è stato principalmente una decisione di prodotto. L'Articolo 50 dell'EU AI Act richiede ai provider di sistemi di AI generativa di marcare i loro output "in un formato leggibile dalle macchine e rilevabile come artificialmente generato o manipolato". L'AI Act è entrato in vigore il 1° agosto 2024; gli obblighi di trasparenza dell'Articolo 50 sono diventati pienamente applicabili il 2 agosto 2026. Questa è la scadenza contro cui ogni provider di frontiera si è preparato silenziosamente.

Il General-Purpose AI Code of Practice — il framework di conformità volontario che la Commissione europea ha pubblicato il 10 luglio 2025 — prende una posizione importante: nessuna tecnica di marcatura singola è sufficiente oggi. Raccomanda un approccio multi-livello che combini metadati (credenziali di contenuto in stile C2PA sui file) e watermarking intrecciato (bias in stile SynthID dentro il contenuto), insieme a logging e fingerprinting per identificare contenuti anche dopo che i marchi sono stati rimossi. Ecco perché vedrai i provider attivare tutti e tre insieme.

Watch out
  • L'Articolo 50 è provider-side. Obbliga il *provider* AI a marcare, e i deployer downstream a fare disclosure — non rende il watermarking prova in tribunale, e non ti impedisce di rimuovere il marchio dal tuo stesso testo. La conformità è su OpenAI/Anthropic/Google/Meta, non su di te come lettore.
  • Il Code of Practice è volontario — ma i firmatari ottengono una presunzione di conformità con l'AI Act. I non firmatari possono comunque conformarsi con propri mezzi, ma affrontano richieste documentali più pesanti.

Cosa cambia nella pratica

Per quattro lettori diversi, quattro takeaway diversi:

Guided walkthrough1 of 4
  1. Assumi che qualsiasi cosa Claude, Gemini o il prossimo modello che usi scriverà porti un watermark di default. I passaggi creativi lunghi sono i più rilevabili; passaggi pesantemente editati o carichi di riferimenti, i meno. Fai disclosure diretta dell'assistenza AI invece di affidarti all'assenza di un watermark per nasconderla — un watermark è facile da sconfiggere, ma le aspettative etiche/di policy non si rilassano perché il rilevamento lo ha fatto.

Cosa potrebbe ancora cambiare

Due grandi domande aperte da guardare:

  1. Rilevamento cross-provider. Oggi ciascun provider ha la propria chiave e il proprio rilevatore. Un watermark di Claude non sarà flaggato dal rilevatore di Gemini, e viceversa. Il Code of Practice accenna a un'eventuale interoperabilità — per esempio, un campo di metadati pubblico che dice "questo contenuto era con watermark, chiedi a questo endpoint per verificare" — ma nulla di production-grade esiste ancora.
  2. Robustezza avversariale. La letteratura accademica sui watermark statistici (parti dal paper Kirchenbauer et al. 2023 che ha reso popolare l'approccio del g-value) mostra già diversi attacchi: parafrasi cross-model, sostituzione a livello di token e retro-traduzione degradano tutti il segnale. I provider lo sanno. Aspettati che gli schemi iterino — gli schemi di watermark diventeranno più robusti, gli attacchi terranno il passo e il valore informativo di un verdetto "rilevato" su testo modificato avversarialmente resterà limitato.

Check yourself

0/5
  1. Cosa cambia effettivamente dentro il modello il watermark SynthID-Text?
  2. Incolli un tweet AI di due frasi in un rilevatore di watermark. Restituisce un punteggio basso. Cosa puoi concludere?
  3. Quale di queste operazioni rimuove più affidabilmente il watermark da un pezzo di prosa generato da Claude?
  4. Quale regolamento UE ha imposto ai provider di generazione testo di avere il watermarking attivo entro il 2 agosto 2026?
  5. Qual è la differenza chiave tra un watermark SynthID-Text e una content credential C2PA?
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 7

Correlati su AILmanac

  • Scelta di un Model Provider — dove le policy del provider (come watermarking, retention dei dati, tier di sicurezza) rientrano in una decisione di scelta.
  • Privacy — come vengono gestiti gli output oltre i soli watermark: retention, uso per training e controlli enterprise.
  • Allucinazioni — i watermark non ti dicono se il testo AI è vero, solo se è stato generato. La verifica è un lavoro separato.
  • Media Generativi: Immagini, Audio, Video — la stessa domanda di provenienza, per le modalità dove C2PA fa la maggior parte del lavoro.

Fonti e approfondimenti