AIテキスト透かし:SynthID-Textが実際に検出できるもの(できないもの)
2026年8月14日、AnthropicはClaudeがテキスト出力に統計的な不可視署名をどのように刻み込んでいるかについての完全なFAQを公開しました。これが初めてではありません — GoogleはSynthID-Textを2024年にGeminiに投入しており、Anthropicの投稿と同じ週に、他のフロンティアプロバイダも静かに同じ機能をオンにしていました。動機はマーケティングではありません。EU AI Act第50条です。生成AIに対する透明性義務が2026年8月2日に完全施行となり、EUにサービスを提供するすべてのプロバイダは、AI生成コンテンツを機械検出可能な形でマークしなければならなくなりました。
ローンチ報道はほぼ「AIテキストに透かしが入った」で終わっていました。それはこの件のなかで最も面白くない部分です。このレッスンは仕組み側です:透かしがどう埋め込まれるか、検出器が実際に何を返すのか、静かに消えてしまう4つの経路、そして「透かしを検出」が本当に意味することです。
- SynthID-Textの仕組みを説明する — 秘密鍵がモデルの発話可能範囲を変えずに、どうトークン選択をバイアスするか
- 検出がいつ効き、いつ効かないかを予測する:文章の長さ、事実的散文と創作的散文、コード、翻訳、校正
- 透かし検出器の出力を正しく読む — それは確率スコアであってイエス/ノーの判定ではない
- 透かしを消す一般的な操作4つと、まったく無傷で残る1つの操作を挙げる
- 2026年8月2日にテキスト透かしを各プロバイダで稼働させたEU AI Act第50条の規則を理解する
核心のアイデア:単語を変えずコインの裏表をバイアスする
LLMはテキストを1トークンずつ生成します。各ステップで語彙上の確率分布を出力し — しばしば無視できない確率を持つ数千の候補トークンから — そこからサンプリングします。「the weather was」と書くと、モデルはsunny、overcast、grey、mild、coolをほぼ同等の選択肢として重み付けするかもしれません。サンプリングが1つを選びます。この最後のコインフリップは通常、任意の乱数源を使います。
透かしは乱数源を、秘密鍵と直前の数トークンの短いウィンドウから決定論的に導かれるものに置き換えます。 語彙は変わっておらず、確率も変わっておらず、特定の単語が強制されているわけでもありません。変わるのは、同等に妥当な選択肢のどれが選ばれやすくなるかです。Anthropicの言葉を借りれば:モデルが全般的にovercastやgreyに偏るわけではなく — overcastがある文で選ばれ、次の文ではgreyが選ばれるかもしれません。十分に長い文章にわたって蓄積されるのは、局所文脈と選ばれたトークンとの間の統計的相関 であり、ランダムなテキストには単純に再現できないものです。この相関こそが透かしです。
Anthropicの実装はSynthID-Textのあるバージョンで、Google DeepMindが2024年に Nature に発表したスキームです(Google DeepMindのSynthID概要を参照)。バイアスがサンプリングの内部に置かれ、モデルが既に許容していたトークン間だけをそっと動かすため、標準ベンチマークでの品質は測定可能なほどには変化しません — それゆえGoogleは、ユーザーに気づかれずGeminiのトラフィックに静かにロールアウトできたのです。
- トークンN+1について、LLMはいつもと同じように語彙上の確率を計算します。再学習なし。フィルタなし。だからモデルの能力に影響しません。
- 秘密鍵とN+1直前のトークン短ウィンドウを組み合わせた種で、各候補トークンに疑似ランダムなg値を割り当てる関数を回します。同じ鍵+同じ文脈=常に同じスコア。
- サンプラーは、出力分布を元に近く保ちながらも、有利なg値を持つ候補をわずかに好むよう傾けられます。単発の選択では見えません。多数の選択を通じて、再現可能なパターンを植え付けます。
- テキストと同じ鍵が与えられれば、検出器は各位置におけるg値がどうなっていたかを計算し、観測されたトークンが高スコア側に落ちた頻度を測ります。ランダムな人間のテキストはチャンス付近のスコア、透かし入りテキストは有意に高いスコアが出ます。
仕組みがいつ検出を壊すかを決める
透かしが消える4つのよくあるパターンはバグではありません — アルゴリズムそのものから直接導かれます。
短い文章。 検出は統計検定です。数文ではトークン選択が少なすぎ、シグナルがノイズを越えられません。Anthropicは明言しています:「小さなサンプルでも検出はうまく機能しない。単語選択が少なく、頼れる情報が少ないからだ」。実務的に:ツイート数語ではなく、数百トークンが必要と考えてください。
事実的テキスト。 次に来るべき正しいトークンが本質的に1つしかない場合(日付、名前、定義、コード識別子)、サンプラーには許容可能な代替がないため、バイアスの掛かる先がありません。Anthropic:「透かしは、テキストの正確性を落とさずに行える選択が少ない事実的文章では希薄になる」。1ページ規模のWikipedia風要約は、同じ長さの創作より単語あたりのシグナル量が少なくなります。
コード。 同じ理由で、さらに厳しくなります。プログラミング構文は概ね固定で、トークンの自由度は主に識別子とコメントに宿ります。Anthropicは認めています:「コード — 多くの場合正確でなければならない — は他のいくつかのテキスト形式より透かしが総じて少ない」。コードに対する検出器スコアは低信頼として扱ってください。
校正と書き換え。 Claudeが人間のテキストを生成する代わりに編集する場合、大半のトークンはユーザーのものであり、透かしを運ぶのは編集部分だけです。軽い校正では実質不可視です。逆に、透かし入りテキストを別の、透かしを持たないモデル に通して大幅に言い換えると、新しいサンプラーがトークンを生成したため、シグナルが除去されます。
意外に思われますが本来意外ではない2点:
- 軽い人間の編集は残る。 数語を差し替えても大部分のシグナルは残ります — 検出器は特定の語句を探しているのではなく、数千の位置に散った小さなバイアスを集計しています。
- 翻訳は依然として透かし入りです — 翻訳は新規生成で、全トークンがモデルによって選ばれるからです。オリジナルの薄まったコピーではなく、別の透かし入り文章になります。
検出器が実際に返すもの
報道で最も誤読されているのはこれです:検出器は**「AI:はい/いいえ」を出力しません**。スコア を出力します — 本質的には「このテキストのトークンパターンは、私たちの鍵に対してどれだけチャンスを超えているか?」 — そして閾値がそのスコアを判定に変え、2つのエラー率が互いにトレードオフします。
- 高スコアはベイズ的証拠であって証明ではありません。長く創造的な文章では強い証拠になり得ます。短いあるいは事実的な文章では、同じスコアの意味はずっと軽くなります。
- 陰性結果はテキストがAI生成でないことを決して証明しません。言い換え、人間の文章との混合、透かしを持たないモデルの利用は、AI著作のテキストを生み出しつつ検出を回避します。
- 検出器には秘密鍵が必要です。Anthropicは信頼されたパートナーに検出APIを提供しており、任意のテキストに対して誰でも回せる公開の「これはClaude?」ツールはありません。
Anthropic自身による検出器保証の要約も、まさにこの通りに調整されています:十分に長い文章と正しい鍵があれば、「そのテキストがClaudeによって生成された確率を割り当てることができる」。確率です。判定ではありません。
ゲートキーピングが重要です。GoogleのSynthID APIドキュメントは、検出器が現時点で限定アクセスであると明記しており、Anthropicも同じ姿勢です — アクセスはジャーナリスト、教育者、正当な検証ニーズを持つプラットフォームへ段階的に拡大されています。これは意図的です:検出器が公開されていれば、敵対者はスコアが閾値を下回るまでテキストを反復的に編集できてしまいます。制限付きアクセスは一定の頑健性を買っています。
透かし vs C2PA vs 分類器 — まったく別の3つのツール
来歴に関する議論はこの3つを一緒くたにしがちです。同じものではないし、競合もしていません。
| ツール | シグナルの所在 | 生成側の協力が必要か? | 言い換えに耐えるか? | 何を教えてくれるか |
|---|---|---|---|---|
| SynthID-Text / 統計的透かし | テキスト内のトークン選択 | はい(サンプリング時にオン) | 部分的 — 軽い編集は耐える、重い書き換えは耐えない | 「このテキストは、この鍵を共有するモデルによって確率Xで生成された」 |
| C2PA / Content Credentials | ファイルに付随する暗号署名済みメタデータ | はい(署名者が資格情報を含める) | いいえ — テキストをコピーアウトすれば簡単に剥がれる | 「このファイルはこの署名者によりこの履歴で公開された」。メタデータが同伴する画像/音声/動画向け。 |
| サードパーティAIテキスト分類器(GPTZero, Pangram等) | テキスト自体の統計的性質、鍵不要 | いいえ | 部分的 — モデルが検出可能なスタイル癖を残せば改善するが、いたちごっこを戦う | 「このテキストは、私のモデルから見るとAI生成っぽく見える」。推測であって署名ではない。 |
要点:透かし はプロバイダ自身の検出器で「この特定のプロバイダのモデル がこれを生成したか?」に答えます。分類器 は真の答えなしに「これは一般的にAI生成に見えるか?」に答えます。C2PA はファイルラッパが存在するメディアについて「誰がこのファイルに署名し、編集履歴はどうか?」に答えます。
AI執筆記事向けの安全な開示プロンプト
When you finish, add a footer: "AI assistance: Draft written by Claude (Anthropic). Edited by [name]. Substantive claims verified against cited sources." Then list any factual claim you couldn't verify from the sources I provided, so I can check or cut it before publishing.
透かしが稼働しても、なぜこれが重要なのか:透かし+人間による開示行は、自動検証と人間検証の両方の経路をカバーします。透かし単体は法的な葉隠れになりかねません — 技術的にはコンプライアンスを満たしても、ページを一瞥する読者には無用です。
これを稼働させた規則:EU AI Act第50条
8月14日の発表は主として製品判断ではありません。EU AI Actの第50条 は、生成AIシステムのプロバイダに対して出力を「機械可読な形式で、人為的に生成または改変されたものとして検出可能にマークする」ことを要求します。AI Actは2024年8月1日に発効し、第50条の透明性義務は2026年8月2日 に完全施行となりました。これがすべてのフロンティアプロバイダが静かに準備してきた締切です。
General-Purpose AI Code of Practice — 2025年7月10日に欧州委員会が公表した自発的コンプライアンス枠組み — は重要な立場を取っています:単一のマーキング技術は今日、十分ではない。ファイル上のメタデータ(C2PA型コンテンツ資格情報)と 織り込み型透かし(SynthID型のコンテンツ内バイアス)を、ロギングとフィンガープリンティング(マークが剥がされた後もコンテンツを識別する)と組み合わせた多層アプローチ を推奨します。だからこそ、プロバイダが3つを同時にオンにしているのが見られるわけです。
- 第50条はプロバイダ側の義務です。AI*プロバイダ*にマークすることを、下流のデプロイヤに開示することを義務付けますが — 透かしを法廷での証拠にするものでも、自分のテキストからマークを剥がすことを止めるものでもありません。コンプライアンスはOpenAI/Anthropic/Google/Metaの側にあり、読者としてのあなたの側にはありません。
- Code of Practiceは自発的 — ただし署名者はAI Actへのコンプライアンス推定を得られます。非署名者も独自の手段でコンプライアンスできますが、より重いドキュメンテーション要求を受けます。
実務で何が変わるか
4種類の読者について、それぞれ4つの持ち帰り:
- Claude、Gemini、次に使うどのモデルが書くものにも既定で透かしが入っていると想定してください。長く創造的な文章が最も検出されやすく、大幅編集や参照重心の文章が最もされにくいです。透かしがないことに隠れて頼るのではなく、AI支援を直接開示してください — 透かしは回避が容易ですが、倫理/ポリシー上の期待は検出できないからといって緩みません。
- 受け取った来歴情報(アップロードされたメディアのC2PAコンテンツ資格情報)を保存してください。AI生成テキストの開示を求めるポリシーを検討し、現在の透かし検出器は確率を返す — 判定ではない — こと、短い投稿では信頼できないことを覚えておいてください。
- コードは何も変わりません。透かしはサンプリング内部で、プロンプトやツール利用の判断の下流で起きます。よいUX開示の代替として独自の「AI生成」バナーを追加しないでください。ユーザーの権利を考えてください:再公開されるテキストを提供するなら、不可視のマークに依存するより、オプトインの開示行の方が親切です。
- 検出器のアクセスが開いてきたら、引用、情報源の一貫性、書き手自身の履歴と並ぶ1つのシグナルとして三角測量に使ってください。短い文章の陽性スコアを決して証明扱いせず、どこであれ陰性スコアを人間著作の証明扱いしないでください。正しい枠組みはベイズ的証拠であって、判定ではありません。
まだ変わりうること
見ておくべき大きな未解決の問い2つ:
- プロバイダ横断検出。 現在は各プロバイダが独自の鍵と検出器を持ちます。Claudeの透かしはGeminiの検出器では引っかからず、その逆も同じです。Code of Practiceは最終的な相互運用性を示唆しています — 例えば「このコンテンツは透かし入り、このエンドポイントに 検証を依頼せよ」と述べる公開メタデータフィールドなど — が、まだ本番級のものは存在しません。
- 敵対的頑健性。 統計的透かしに関する学術文献(g値アプローチを広めたKirchenbauerら2023年論文から始めてください)は既にいくつかの攻撃を示しています:モデル横断の言い換え、トークンレベルの置換、逆翻訳がそれぞれシグナルを劣化させます。プロバイダはこれを知っています。スキームは反復されるでしょう — 透かしスキームはより頑健になり、攻撃も歩調を合わせ、敵対的に編集されたテキストに対する「検出」判定の情報価値は限定的であり続けるでしょう。
Check yourself
0/5AILmanacの関連ページ
- モデルプロバイダを選ぶ — プロバイダのポリシー(透かし、データ保持、安全ティアなど)が選定判断にどう入るか。
- プライバシー — 透かしにとどまらず、出力がどう扱われるか:保持、学習利用、エンタープライズ制御。
- ハルシネーション — 透かしはAIテキストが真実か は教えず、生成されたかどうかしか教えない。検証は別仕事。
- 生成メディア:画像、音声、動画 — 同じ来歴問題を、C2PAが主に担うモダリティについて。
出典と参考文献
- Claudeのテキスト透かしの仕組み — Anthropic(2026年8月14日) — このページが総合する一次FAQ。
- SynthID概要 — Google DeepMind — SynthID-Textが属する透かしツール群。
- SynthID Text safeguards docs — Google AI — SynthID-TextがAPIとして公開されている形と、検出器アクセスの注意事項。
- Kirchenbauerら「A Watermark for Large Language Models」(2023) — 現在のスキームの土台となるg値/レッドリスト機構。
- EU AI Act — 第50条と2026年8月2日施行日のWikipedia要約 — 透かしをプロバイダ横断で稼働させた規制。
- General-Purpose AI Code of Practice — Wikipedia — 透かし+メタデータ+ロギングの層状化を推奨する自発的枠組み。
- Coalition for Content Provenance and Authenticity (C2PA) — テキスト透かしを補完するメディア来歴標準。