Filigranes de texte IA : ce que SynthID-Text détecte vraiment (et ce qu'il ne détecte pas)
Le 14 août 2026, Anthropic a publié une FAQ complète sur la façon dont Claude estampille désormais une signature statistique invisible dans son texte de sortie. Ce n'est pas le premier — Google a livré SynthID-Text pour Gemini en 2024, et la même semaine que la publication d'Anthropic, d'autres fournisseurs frontière activaient discrètement la même fonctionnalité. La fonction forçante n'est pas le marketing. C'est l'Article 50 de l'EU AI Act, dont les obligations de transparence pour l'IA générative sont devenues pleinement applicables le 2 août 2026 — chaque fournisseur desservant l'UE doit désormais marquer le contenu généré par IA de manière détectable par machine.
La couverture médiatique du lancement disait surtout « le texte IA a désormais des filigranes ». C'est la chose la moins intéressante à ce sujet. Cette leçon porte sur le mécanisme : comment le filigrane est intégré, ce qu'un détecteur renvoie réellement, les quatre façons dont il disparaît silencieusement, et ce que « filigrane détecté » signifie vraiment.
- Expliquer le mécanisme SynthID-Text — comment une clé secrète biaise la sélection de tokens sans changer ce que le modèle peut dire
- Prédire quand la détection fonctionnera et ne fonctionnera pas : longueur du passage, prose factuelle vs créative, code, traduction, relecture
- Lire correctement la sortie d'un détecteur de filigrane — il renvoie un score de probabilité, pas un verdict oui/non
- Lister les quatre opérations courantes qui effacent le filigrane, et la seule qui le laisse pleinement intact
- Comprendre la règle de l'Article 50 de l'EU AI Act qui a forcé le filigranage de texte à être activé chez les fournisseurs le 2 août 2026
L'idée centrale : biaiser le tirage au sort, ne pas changer les mots
Un LLM génère du texte un token à la fois. À chaque étape, il produit une distribution de probabilité sur le vocabulaire — souvent des milliers de tokens candidats avec une probabilité non triviale — et échantillonne à partir de celle-ci. Lorsque vous écrivez « le temps était », le modèle peut pondérer ensoleillé, couvert, gris, doux, frais comme des choix à peu près équivalents ; l'échantillonnage en choisit un. Ce tirage final utilise normalement une source aléatoire arbitraire.
Un filigrane remplace la source aléatoire par une source déterministe dérivée d'une clé secrète et d'une courte fenêtre des tokens qui viennent juste avant. Le vocabulaire n'a pas changé, les probabilités n'ont pas changé, et aucun mot spécifique n'est forcé. Ce qui change, c'est quel des choix également plausibles a tendance à être sélectionné. Comme le formule Anthropic : ce n'est pas que le modèle devient biaisé vers couvert ou gris en général — couvert peut être sélectionné dans une phrase, gris dans la suivante. Ce qui s'accumule sur un passage suffisamment long est une corrélation statistique entre le contexte local et le token choisi que du texte aléatoire ne peut simplement pas reproduire. Cette corrélation est le filigrane.
L'implémentation d'Anthropic est une version de SynthID-Text, le schéma que Google DeepMind a publié dans Nature en 2024 (voir l'aperçu de SynthID par Google DeepMind). Parce que le biais se situe à l'intérieur de l'échantillonnage et ne fait que nuancer entre des tokens que le modèle considérait déjà comme acceptables, la qualité sur les benchmarks standard reste mesurablement inchangée — c'est ce qui a permis à Google de le déployer silencieusement sur le trafic Gemini sans que les utilisateurs le remarquent.
- Pour le token N+1, le LLM calcule les probabilités sur le vocabulaire comme il le ferait toujours. Pas de réentraînement. Pas de filtre. C'est pourquoi la capacité du modèle n'est pas affectée.
- Une clé secrète combinée à une courte fenêtre de tokens juste avant la position N+1 amorce une fonction qui attribue à chaque token candidat une valeur g pseudo-aléatoire. Même clé + même contexte = mêmes scores, toujours.
- L'échantillonneur est légèrement incliné pour préférer les candidats avec des valeurs g favorables, tout en gardant la distribution de sortie proche de l'originale. Sur un choix isolé, c'est invisible. Sur de nombreux choix, cela plante un motif reproductible.
- Étant donné le texte et la même clé, le détecteur calcule ce qu'auraient été les valeurs g à chaque position et mesure combien de fois les tokens observés ont atterri sur des options à score élevé. Un texte humain aléatoire obtient un score proche du hasard ; un texte filigrané obtient un score significativement supérieur.
Pourquoi le mécanisme décide quand la détection échoue
Les quatre façons courantes dont le filigrane disparaît ne sont pas des bugs — elles découlent directement de ce que l'algorithme fait réellement.
Passages courts. La détection est un test statistique. Quelques phrases produisent trop peu de choix de tokens pour que le signal s'élève au-dessus du bruit. Anthropic le note explicitement : « détecter un filigrane ne fonctionne pas bien non plus sur de petits échantillons, où il y a moins de choix de mots et donc moins d'informations sur lesquelles s'appuyer. » En pratique : attendez-vous à ce qu'une détection fiable ait besoin de centaines de tokens, pas de tweets.
Texte factuel. Lorsqu'il y a essentiellement un seul token suivant correct — une date, un nom, une définition, un identifiant de code — l'échantillonneur n'a pas d'alternatives acceptables parmi lesquelles choisir, donc le biais n'a nulle part où s'attacher. Anthropic : « le filigranage est plus rare sur les passages factuels où il y a moins de choix qui peuvent être faits sans diminuer la précision du texte. » Un résumé de style Wikipédia d'une page portera moins de signal par mot que la même longueur d'écriture créative.
Code. Même raison, plus difficile. La syntaxe de programmation est largement fixée ; la flexibilité des tokens réside principalement dans les identifiants et les commentaires. Anthropic reconnaît que « le code — qui dans de très nombreux cas doit être exact — a généralement moins de filigranage que d'autres formes de texte. » Traitez les scores du détecteur sur du code comme peu fiables.
Relecture et réécriture. Lorsque Claude édite du texte humain au lieu de le générer, la plupart des tokens sont les tokens de l'utilisateur ; seules les modifications portent le filigrane. Une relecture douce est essentiellement invisible. À l'inverse, faire passer du texte filigrané à travers un modèle différent, non filigranant pour le paraphraser fortement supprime le signal, car un nouvel échantillonneur a produit les tokens.
Deux choses qui surprennent les gens, mais qui ne devraient pas :
- Une édition humaine légère survit. Échanger quelques mots laisse la plupart du signal intact — le détecteur agrège un petit biais sur des milliers de positions, il ne cherche pas des phrases spécifiques.
- La traduction est toujours filigranée — parce qu'une traduction est une génération fraîche où chaque token est choisi par le modèle. C'est un passage filigrané différent, pas une copie diluée de l'original.
Ce que le détecteur renvoie réellement
La chose la plus mal interprétée sur les filigranes dans la couverture médiatique : un détecteur ne produit pas « IA : oui / non ». Il produit un score — essentiellement « à quelle distance au-dessus du hasard tombe le motif des tokens de ce texte pour notre clé ? » — et un seuil transforme ce score en une décision, avec deux taux d'erreur qui s'échangent l'un contre l'autre.
- Un score élevé est une preuve bayésienne, pas une preuve absolue. Sur un long passage créatif, cela peut être une preuve forte. Sur un passage court ou factuel, le même score signifie beaucoup moins.
- Un résultat négatif ne prouve jamais que le texte n'a pas été généré par IA. La paraphrase, le mélange avec de l'écriture humaine, ou l'utilisation d'un modèle non filigranant vainquent tous la détection tout en produisant du texte rédigé par IA.
- Le détecteur a besoin de la clé secrète. Anthropic propose l'API de détection à des partenaires de confiance ; il n'existe pas d'outil public « est-ce Claude ? » que quiconque puisse exécuter sur un texte arbitraire.
Le propre résumé d'Anthropic de la garantie du détecteur est calibré exactement de cette manière : étant donné un passage suffisamment long et la bonne clé, « on peut attribuer une probabilité que le texte ait été généré par Claude ». Probabilité. Pas verdict.
Le contrôle d'accès importe. La documentation de l'API SynthID de Google est explicite sur le fait que le détecteur est actuellement à accès limité ; Anthropic est dans la même posture — l'accès est étendu par étapes aux journalistes, éducateurs et plateformes ayant un besoin de vérification légitime. C'est délibéré : si le détecteur était public, les adversaires pourraient éditer itérativement le texte jusqu'à ce que le score tombe sous le seuil. L'accès restreint achète une certaine robustesse.
Filigrane vs C2PA vs classifieur — trois outils totalement différents
Le discours sur la provenance mélange ces trois éléments. Ils ne sont pas identiques et ne se concurrencent pas.
| Outil | Le signal réside dans | Nécessite la coopération du générateur ? | Survit à la paraphrase ? | Ce qu'il vous dit |
|---|---|---|---|---|
| SynthID-Text / filigrane statistique | Les choix de tokens à l'intérieur du texte | Oui (activé au moment de l'échantillonnage) | Partiellement — éditions légères oui, réécriture lourde non | « Ce texte a été généré par un modèle qui partage cette clé, avec une probabilité X. » |
| C2PA / Content Credentials | Métadonnées signées cryptographiquement attachées au fichier | Oui (le signataire inclut le credential) | Non — trivialement supprimé en copiant le texte | « Ce fichier a été publié par ce signataire avec cet historique. » Destiné aux images/audio/vidéo où les métadonnées voyagent avec. |
| Classifieur tiers de texte IA (GPTZero, Pangram, etc.) | Propriétés statistiques du texte lui-même, sans clé | Non | Partiellement — s'améliore à mesure que les modèles laissent un style détectable, mais mène une course aux armements | « Ce texte ressemble à du texte généré par IA, selon mon modèle. » Une supposition, pas une signature. |
La leçon : un filigrane répond à « ce modèle spécifique du fournisseur a-t-il généré ceci ? » avec le propre détecteur du fournisseur. Un classifieur répond à « cela ressemble-t-il à du texte généré par IA en général ? » sans vérité terrain. C2PA répond à « qui a signé ce fichier et quel est son historique d'édition ? » pour les médias où un wrapper de fichier existe.
Une invite de divulgation plus sûre pour les articles rédigés par IA
When you finish, add a footer: "AI assistance: Draft written by Claude (Anthropic). Edited by [name]. Substantive claims verified against cited sources." Then list any factual claim you couldn't verify from the sources I provided, so I can check or cut it before publishing.
Pourquoi cela importe même avec des filigranes en direct : un filigrane plus une ligne de divulgation humaine couvre à la fois les voies de vérification automatisée et humaine. Un filigrane seul devient une feuille de vigne légale — techniquement conforme, inutile pour un lecteur jetant un coup d'œil à la page.
La règle qui a forcé cela : l'Article 50 de l'EU AI Act
L'annonce du 14 août n'était pas principalement une décision produit. L'Article 50 de l'EU AI Act exige que les fournisseurs de systèmes d'IA générative marquent leurs sorties « dans un format lisible par machine et détectable comme générées ou manipulées artificiellement ». L'AI Act est entré en vigueur le 1er août 2024 ; les obligations de transparence de l'Article 50 sont devenues pleinement applicables le 2 août 2026. C'est l'échéance contre laquelle chaque fournisseur frontière construit discrètement.
Le General-Purpose AI Code of Practice — le cadre de conformité volontaire que la Commission européenne a publié le 10 juillet 2025 — prend une position importante : aucune technique de marquage unique n'est suffisante aujourd'hui. Il recommande une approche multicouche combinant les métadonnées (content credentials de style C2PA sur les fichiers) et le filigranage entrelacé (biais de style SynthID à l'intérieur du contenu), avec la journalisation et l'empreinte pour identifier le contenu même après que les marques sont supprimées. C'est pourquoi vous verrez les fournisseurs activer les trois en même temps.
- L'Article 50 est du côté du fournisseur. Il oblige le *fournisseur* d'IA à marquer, et les déployeurs en aval à divulguer — il ne rend pas le filigranage recevable devant un tribunal, et il ne vous empêche pas de retirer la marque de votre propre texte. La conformité est sur OpenAI/Anthropic/Google/Meta, pas sur vous en tant que lecteur.
- Le Code of Practice est volontaire — mais les signataires bénéficient d'une présomption de conformité avec l'AI Act. Les non-signataires peuvent toujours se conformer par leurs propres moyens, mais font face à des exigences documentaires plus lourdes.
Ce que cela change en pratique
Pour quatre lecteurs différents, quatre enseignements différents :
- Supposez que tout ce que Claude, Gemini, ou le prochain modèle que vous utilisez écrit porte un filigrane par défaut. Les longs passages créatifs sont les plus détectables ; les passages fortement édités ou riches en références, les moins. Divulguez l'assistance IA directement plutôt que de compter sur l'absence de filigrane pour la cacher — un filigrane est facile à vaincre, mais les attentes éthiques/politiques ne s'assouplissent pas parce que la détection l'a fait.
- Préservez la provenance que vous recevez (content credentials C2PA sur les médias téléchargés). Envisagez une politique qui exige la divulgation du texte généré par IA, et souvenez-vous que les détecteurs de filigrane actuels donnent des probabilités — pas des verdicts — et ne seront pas fiables sur les courtes publications.
- Rien dans votre code ne change. Le filigranage se produit à l'intérieur de l'échantillonnage, en aval de toute décision de prompt ou d'utilisation d'outil. N'ajoutez pas vos propres bannières « généré par IA » comme substitut à une bonne divulgation UX. Pensez aux droits de vos utilisateurs : si vous proposez du texte qui sera republié, une ligne de divulgation opt-in est plus conviviale que de compter sur des marques invisibles.
- Lorsque l'accès au détecteur s'ouvrira, utilisez-le comme un signal dans une triangulation — aux côtés des citations, de la cohérence des sources et de l'historique du rédacteur. Ne traitez jamais un score positif sur un passage court comme une preuve, et ne traitez jamais un score négatif où que ce soit comme une preuve de rédaction humaine. Le bon cadre est la preuve bayésienne, pas le verdict.
Ce qui pourrait encore changer
Deux grandes questions ouvertes à surveiller :
- Détection inter-fournisseurs. Aujourd'hui, chaque fournisseur a sa propre clé et son propre détecteur. Un filigrane de Claude ne sera pas signalé par le détecteur de Gemini, et vice versa. Le Code of Practice évoque une interopérabilité éventuelle — par exemple, un champ de métadonnées public qui dit « ce contenu a été filigrané, demandez à ce point de terminaison de vérifier » — mais rien de production-ready n'existe encore.
- Robustesse adversariale. La littérature académique sur les filigranes statistiques (commencez par l'article de Kirchenbauer et al. 2023 qui a popularisé l'approche des valeurs g) montre déjà plusieurs attaques : la paraphrase inter-modèles, la substitution au niveau du token et la rétro-traduction dégradent chacune le signal. Les fournisseurs le savent. Attendez-vous à ce que les schémas itèrent — les schémas de filigrane deviendront plus robustes, les attaques suivront le rythme, et la valeur informationnelle d'un verdict « détecté » sur du texte adversarialement édité restera limitée.
Check yourself
0/5Sur AILmanac
- Choisir un fournisseur de modèle — où les politiques du fournisseur (comme le filigranage, la rétention des données, les niveaux de sécurité) s'inscrivent dans une décision de choix.
- Confidentialité — comment les sorties sont gérées au-delà des simples filigranes : rétention, utilisation pour l'entraînement, et contrôles entreprise.
- Hallucinations — les filigranes ne vous disent pas si le texte IA est vrai, seulement s'il a été généré. La vérification est un travail distinct.
- Médias génératifs : image, audio, vidéo — la même question de provenance, pour les modalités où C2PA fait la majeure partie du travail.
Sources et lectures complémentaires
- Comment fonctionne le filigranage de texte de Claude — Anthropic (14 août 2026) — la FAQ principale que cette page synthétise.
- Aperçu SynthID — Google DeepMind — la famille d'outils de filigranage dont SynthID-Text fait partie.
- Documentation des garanties SynthID Text — Google AI — comment SynthID-Text est exposé en tant qu'API, avec des notes sur l'accès au détecteur.
- Kirchenbauer et al., « A Watermark for Large Language Models » (2023) — le mécanisme des valeurs g / listes rouges sur lequel les schémas actuels sont construits.
- EU AI Act — résumé Wikipedia de l'Article 50 et de la date d'application du 2 août 2026 — la réglementation qui a forcé le filigranage à être activé chez les fournisseurs.
- General-Purpose AI Code of Practice — Wikipedia — le cadre volontaire recommandant filigrane + métadonnées + journalisation en couches.
- Coalition for Content Provenance and Authenticity (C2PA) — le standard de provenance des médias qui complète les filigranes de texte.