Zum Hauptinhalt springen

KI-Text-Wasserzeichen: Was SynthID-Text wirklich erkennt (und was nicht)

Fortgeschritten

Am 14. August 2026 veröffentlichte Anthropic eine ausführliche FAQ dazu, wie Claude nun eine unsichtbare statistische Signatur in seine Textausgabe einprägt. Es ist nicht der erste Anbieter — Google hat SynthID-Text 2024 für Gemini ausgeliefert, und in derselben Woche, in der Anthropics Beitrag erschien, aktivierten andere Frontier-Anbieter dasselbe Feature still und leise. Die treibende Kraft ist kein Marketing. Es ist Artikel 50 der EU-KI-Verordnung, dessen Transparenzpflichten für generative KI seit dem 2. August 2026 vollständig durchsetzbar sind — jeder Anbieter, der die EU beliefert, muss KI-generierte Inhalte nun maschinenlesbar kennzeichnen.

Die Berichterstattung über den Launch beschränkte sich meist auf „KI-Text hat jetzt Wasserzeichen". Das ist das Uninteressanteste daran. Diese Lektion behandelt den Mechanismus: wie das Wasserzeichen eingebettet wird, was ein Detektor tatsächlich zurückgibt, die vier Wege, auf denen es lautlos verschwindet, und was „Wasserzeichen erkannt" wirklich aussagt.

What you'll learn
  • Den SynthID-Text-Mechanismus erklären — wie ein geheimer Schlüssel die Token-Auswahl beeinflusst, ohne zu ändern, was das Modell sagen kann
  • Vorhersagen, wann Erkennung funktioniert und wann nicht: Passagenlänge, faktische vs. kreative Prosa, Code, Übersetzung, Korrekturlesen
  • Die Ausgabe eines Wasserzeichen-Detektors korrekt lesen — er gibt einen Wahrscheinlichkeitswert zurück, kein Ja/Nein-Urteil
  • Die vier gängigen Operationen auflisten, die das Wasserzeichen löschen, und die eine, die es vollständig erhält
  • Die Artikel-50-Regel der EU-KI-Verordnung verstehen, die Text-Wasserzeichen am 2. August 2026 anbieterübergreifend live erzwungen hat

Die Kernidee: den Münzwurf beeinflussen, nicht die Wörter ändern

Ein LLM erzeugt Text Token für Token. Bei jedem Schritt produziert es eine Wahrscheinlichkeitsverteilung über das Vokabular — oft Tausende von Kandidaten-Tokens mit nicht-trivialer Wahrscheinlichkeit — und sampelt daraus. Wenn du „das Wetter war" schreibst, könnte das Modell sonnig, bewölkt, grau, mild, kühl als in etwa gleichwertige Optionen gewichten; das Sampling wählt eine aus. Dieser letzte Münzwurf nutzt normalerweise eine beliebige Zufallsquelle.

Ein Wasserzeichen ersetzt die Zufallsquelle durch eine deterministische, die aus einem geheimen Schlüssel und einem kurzen Fenster der unmittelbar vorangehenden Tokens abgeleitet wird. Das Vokabular hat sich nicht geändert, die Wahrscheinlichkeiten haben sich nicht geändert, und kein bestimmtes Wort wird erzwungen. Was sich ändert, ist, welche der gleich plausiblen Optionen tendenziell gewählt wird. Wie Anthropic es formuliert: Es ist nicht so, dass das Modell allgemein zu bewölkt oder grau tendiert — bewölkt könnte in einem Satz gewählt werden, grau im nächsten. Was sich über eine ausreichend lange Passage ansammelt, ist eine statistische Korrelation zwischen dem lokalen Kontext und dem gewählten Token, die zufälliger Text schlicht nicht reproduzieren kann. Diese Korrelation ist das Wasserzeichen.

Anthropics Implementierung ist eine Variante von SynthID-Text, dem Verfahren, das Google DeepMind 2024 in Nature veröffentlichte (siehe die SynthID-Übersicht von Google DeepMind). Weil der Bias innerhalb des Samplings sitzt und nur zwischen Tokens tariert, die das Modell ohnehin als akzeptabel betrachtet, ist die Qualität auf Standard-Benchmarks messbar unverändert — was Google erlaubte, es ohne Aufsehen bei Gemini-Traffic auszurollen.

Guided walkthrough1 of 4
  1. Für Token N+1 berechnet das LLM die Wahrscheinlichkeiten über das Vokabular wie immer. Kein Re-Training. Kein Filter. Deshalb bleibt die Modellfähigkeit unangetastet.

Warum der Mechanismus entscheidet, wann die Erkennung scheitert

Die vier gängigen Wege, auf denen das Wasserzeichen verschwindet, sind keine Bugs — sie folgen direkt daraus, was der Algorithmus tatsächlich tut.

Kurze Passagen. Erkennung ist ein statistischer Test. Ein paar Sätze produzieren zu wenige Token-Entscheidungen, damit das Signal über das Rauschen steigt. Anthropic sagt explizit: „Wasserzeichen-Erkennung funktioniert auch bei kleinen Stichproben nicht gut, wo es weniger Wortwahlmöglichkeiten und damit weniger Information gibt, auf die man sich stützen kann." Praktisch: Zuverlässige Erkennung braucht Hunderte von Tokens, keine Tweets.

Faktischer Text. Wenn es im Grunde nur ein korrektes nächstes Token gibt — ein Datum, einen Namen, eine Definition, einen Code-Identifier — hat der Sampler keine akzeptablen Alternativen zur Auswahl, also hat der Bias nichts, woran er sich festmachen könnte. Anthropic: „Wasserzeichen sind bei faktischen Passagen spärlicher, wo weniger Entscheidungen möglich sind, ohne die Genauigkeit des Textes zu verringern." Eine seitenlange Wikipedia-artige Zusammenfassung trägt weniger Signal pro Wort als dieselbe Länge kreatives Schreiben.

Code. Gleicher Grund, schwieriger. Programmiersprachliche Syntax ist weitgehend festgelegt; Token-Flexibilität lebt hauptsächlich in Identifiern und Kommentaren. Anthropic räumt ein: „Code — der in sehr vielen Fällen exakt sein muss — hat generell weniger Wasserzeichen als manche andere Textformen." Behandle Detektor-Scores auf Code als geringes Vertrauensniveau.

Korrekturlesen und Umschreiben. Wenn Claude menschlichen Text editiert statt zu generieren, sind die meisten Tokens die Tokens des Nutzers; nur die Bearbeitungen tragen das Wasserzeichen. Ein sanftes Korrekturlesen ist praktisch unsichtbar. Umgekehrt entfernt das Durchlaufen von Text mit Wasserzeichen durch ein anderes, nicht wasserzeichnendes Modell zum starken Paraphrasieren das Signal, weil ein neuer Sampler die Tokens erzeugt hat.

Zwei Dinge, die überraschen, aber nicht sollten:

  • Leichte menschliche Bearbeitung überlebt. Das Austauschen einiger Wörter lässt den Großteil des Signals intakt — der Detektor aggregiert einen kleinen Bias über Tausende von Positionen, er sucht nicht nach bestimmten Phrasen.
  • Übersetzung ist weiterhin mit Wasserzeichen versehen — weil eine Übersetzung eine frische Generierung ist, bei der jedes Token vom Modell gewählt wird. Es ist eine andere Passage mit Wasserzeichen, keine verwässerte Kopie des Originals.

Was der Detektor tatsächlich zurückgibt

Das am meisten missverstandene Detail zu Wasserzeichen in der Presseberichterstattung: Ein Detektor gibt nicht „KI: ja / nein" aus. Er gibt einen Score aus — im Wesentlichen „wie weit über dem Zufall liegt das Token-Muster dieses Textes für unseren Schlüssel?" — und ein Schwellenwert macht daraus eine Entscheidung, mit zwei Fehlerraten, die gegeneinander abgewogen werden.

Watch out
  • Ein hoher Score ist bayes'sche Evidenz, kein Beweis. Bei einer langen, kreativen Passage kann es starke Evidenz sein. Bei einer kurzen oder faktischen bedeutet derselbe Score viel weniger.
  • Ein negatives Ergebnis beweist nie, dass der Text nicht KI-generiert war. Paraphrasieren, Mischen mit menschlichem Schreiben oder die Nutzung eines nicht wasserzeichnenden Modells hebeln die Erkennung aus und produzieren dennoch KI-verfassten Text.
  • Der Detektor braucht den geheimen Schlüssel. Anthropic bietet die Detektions-API vertrauenswürdigen Partnern an; es gibt kein öffentliches ‚Ist das Claude?'-Tool, das jeder auf beliebigen Text loslassen könnte.

Anthropics eigene Zusammenfassung der Detektor-Garantie ist genau so kalibriert: Bei einer ausreichend langen Passage und dem richtigen Schlüssel „lässt sich eine Wahrscheinlichkeit angeben, dass der Text von Claude generiert wurde." Wahrscheinlichkeit. Kein Urteil.

Die Zugangskontrolle ist wichtig. Googles SynthID-API-Dokumentation ist explizit, dass der Detektor derzeit nur eingeschränkt zugänglich ist; Anthropic verfolgt dieselbe Haltung — der Zugang wird schrittweise auf Journalisten, Pädagogen und Plattformen mit einem legitimen Verifizierungsbedarf ausgeweitet. Das ist Absicht: Wäre der Detektor öffentlich, könnten Angreifer den Text iterativ bearbeiten, bis der Score unter den Schwellenwert fällt. Beschränkter Zugang erkauft ein wenig Robustheit.

Wasserzeichen vs. C2PA vs. Klassifikator — drei völlig unterschiedliche Werkzeuge

Der Provenienz-Diskurs wirft diese drei durcheinander. Sie sind nicht dasselbe und konkurrieren nicht.

WerkzeugSignal liegt inMuss der Generator mitspielen?Übersteht Paraphrasieren?Was es dir sagt
SynthID-Text / statistisches WasserzeichenToken-Auswahl innerhalb des TextesJa (zur Sampling-Zeit aktiviert)Teilweise — leichte Änderungen ja, starkes Umschreiben nein„Dieser Text wurde von einem Modell generiert, das diesen Schlüssel teilt, mit Wahrscheinlichkeit X."
C2PA / Content CredentialsKryptografisch signierte Metadaten, die an die Datei angehängt sindJa (Signierer fügt Credential ein)Nein — trivial entfernbar durch Herauskopieren des Textes„Diese Datei wurde von diesem Signierer mit dieser Historie veröffentlicht." Zielt auf Bilder/Audio/Video, wo Metadaten mitreisen.
Drittanbieter-KI-Text-Klassifikator (GPTZero, Pangram usw.)Statistische Eigenschaften des Textes selbst, kein SchlüsselNeinTeilweise — verbessert sich, solange Modelle einen erkennbaren Stil hinterlassen, kämpft aber gegen ein Wettrüsten„Dieser Text sieht aus wie KI-generierter Text, laut meinem Modell." Eine Schätzung, keine Signatur.

Die Lehre: Ein Wasserzeichen beantwortet „hat das spezifische Modell dieses Anbieters das generiert?" mit dem Detektor des Anbieters. Ein Klassifikator beantwortet „sieht das allgemein KI-generiert aus?" ohne Grundwahrheit. C2PA beantwortet „wer hat diese Datei signiert und wie ist ihre Bearbeitungshistorie?" für Medien, wo ein Datei-Wrapper existiert.

Ein sichererer Offenlegungs-Prompt für KI-verfasste Beiträge

When you finish, add a footer:
"AI assistance: Draft written by Claude (Anthropic). Edited by [name]. Substantive claims verified against cited sources."

Then list any factual claim you couldn't verify from the sources I provided,
so I can check or cut it before publishing.

Warum das auch mit aktiven Wasserzeichen wichtig ist: Ein Wasserzeichen plus eine menschliche Offenlegungszeile deckt beide Verifizierungspfade ab — automatisiert und menschlich. Ein Wasserzeichen allein wird zu einem juristischen Feigenblatt — technisch konform, nutzlos für einen Leser, der die Seite überfliegt.

Die Regel, die das live erzwungen hat: EU-KI-Verordnung Artikel 50

Die Ankündigung vom 14. August war nicht primär eine Produktentscheidung. Artikel 50 der EU-KI-Verordnung verpflichtet Anbieter generativer KI-Systeme, ihre Ausgaben „in einem maschinenlesbaren Format zu kennzeichnen und als künstlich generiert oder manipuliert erkennbar zu machen." Die KI-Verordnung trat am 1. August 2024 in Kraft; die Transparenzpflichten unter Artikel 50 wurden am 2. August 2026 vollständig durchsetzbar. Das ist die Frist, gegen die jeder Frontier-Anbieter still gebaut hat.

Der General-Purpose AI Code of Practice — der freiwillige Compliance-Rahmen, den die Europäische Kommission am 10. Juli 2025 veröffentlichte — nimmt eine wichtige Position ein: Keine einzelne Kennzeichnungstechnik reicht heute aus. Er empfiehlt einen mehrschichtigen Ansatz, der Metadaten (C2PA-artige Content Credentials auf Dateien) und eingewobene Wasserzeichen (SynthID-artiger Bias im Inhalt) kombiniert, zusammen mit Logging und Fingerprinting, um Inhalte selbst dann zu identifizieren, wenn Markierungen entfernt wurden. Deshalb siehst du, dass Anbieter alle drei gleichzeitig aktivieren.

Watch out
  • Artikel 50 ist anbieterseitig. Er verpflichtet den KI-*Anbieter* zur Kennzeichnung und nachgelagerte Deployer zur Offenlegung — er macht Wasserzeichen nicht zu Beweismitteln vor Gericht, und er hindert dich nicht daran, die Markierung aus deinem eigenen Text zu entfernen. Compliance liegt bei OpenAI/Anthropic/Google/Meta, nicht bei dir als Leser.
  • Der Code of Practice ist freiwillig — aber Unterzeichner erhalten eine Compliance-Vermutung mit der KI-Verordnung. Nicht-Unterzeichner können weiterhin über eigene Mittel konform sein, sehen sich aber schwereren Dokumentationsanforderungen gegenüber.

Was das in der Praxis ändert

Für vier verschiedene Leser, vier verschiedene Lehren:

Guided walkthrough1 of 4
  1. Geh davon aus, dass alles, was Claude, Gemini oder das nächste Modell, das du nutzt, schreibt, standardmäßig ein Wasserzeichen trägt. Lange kreative Passagen sind am besten erkennbar; stark editierte oder referenzlastige Passagen am schlechtesten. Lege KI-Unterstützung direkt offen, statt dich darauf zu verlassen, dass die Abwesenheit eines Wasserzeichens sie verbirgt — ein Wasserzeichen ist leicht auszuhebeln, aber die ethischen/politischen Erwartungen entspannen sich nicht, weil die Erkennung es tat.

Was sich noch ändern könnte

Zwei große offene Fragen zu beobachten:

  1. Anbieterübergreifende Erkennung. Heute hat jeder Anbieter seinen eigenen Schlüssel und eigenen Detektor. Ein Wasserzeichen von Claude wird nicht von Geminis Detektor markiert, und umgekehrt. Der Code of Practice deutet eventuelle Interoperabilität an — zum Beispiel ein öffentliches Metadatenfeld, das sagt „dieser Inhalt wurde mit Wasserzeichen versehen, frag diesen Endpunkt zur Verifikation" — aber nichts Produktionsreifes existiert bisher.
  2. Adversariale Robustheit. Akademische Literatur zu statistischen Wasserzeichen (starte mit dem Paper von Kirchenbauer et al. 2023, das den g-Wert-Ansatz populär machte) zeigt bereits mehrere Angriffe: modellübergreifendes Paraphrasieren, Token-Ebene-Substitution und Rückübersetzung degradieren jeweils das Signal. Anbieter wissen das. Erwarte, dass die Verfahren iterieren — Wasserzeichen-Verfahren werden robuster, Angriffe halten Schritt, und der Informationswert eines „erkannt"-Urteils bei adversarial editiertem Text wird begrenzt bleiben.

Check yourself

0/5
  1. Was ändert das SynthID-Text-Wasserzeichen tatsächlich innerhalb des Modells?
  2. Du fügst einen zwei Sätze langen KI-generierten Tweet in einen Wasserzeichen-Detektor ein. Er liefert einen niedrigen Score. Was kannst du daraus schließen?
  3. Welche dieser Operationen entfernt am zuverlässigsten das Wasserzeichen aus einem Stück von Claude generierter Prosa?
  4. Welche EU-Verordnung hat Text-Generierungs-Anbieter gezwungen, bis zum 2. August 2026 Wasserzeichen live zu haben?
  5. Was ist der wichtige Unterschied zwischen einem SynthID-Text-Wasserzeichen und einem C2PA-Content-Credential?
Drücke Enter oder die Leertaste, um die Karte umzudrehen. Nutze die Pfeiltasten links und rechts, um zwischen den Karten zu wechseln.Begriff angezeigt.
1 / 7

Verwandtes auf AILmanac

  • Einen Modell-Anbieter wählen — wo Anbieter-Richtlinien (wie Wasserzeichen, Datenaufbewahrung, Sicherheitsstufen) in eine Auswahlentscheidung passen.
  • Datenschutz — wie Ausgaben über Wasserzeichen hinaus behandelt werden: Aufbewahrung, Trainingsnutzung und Enterprise-Kontrollen.
  • Halluzinationen — Wasserzeichen sagen dir nicht, ob KI-Text wahr ist, nur ob er generiert wurde. Verifikation ist eine separate Aufgabe.
  • Generative Medien: Bild, Audio, Video — dieselbe Provenienzfrage, für die Modalitäten, in denen C2PA den Großteil der Arbeit leistet.

Quellen & weiterführende Lektüre