コピペしても消えない「透かし」——Claudeの文章に埋め込まれた、目に見えない印の正体
8月11日、Anthropicが、Claudeが生成するテキストに、機械可読な透かし(ウォーターマーク)を埋め込む仕組みを、世界中で有効化したことを正式に発表した。EUのAI規則(AI Act)が求める透明性義務への対応が直接のきっかけだが、その適用範囲はEUだけにとどまらない。エンジニアとして、この透かしが技術的にどう機能し、何ができて何ができないのかを、正確に理解しておきたい。
きっかけは「EU AI Act第50条」
この透かし機能導入の直接の引き金は、8月2日に施行されたEUのAI Act第50条の透明性義務だ。以前取り上げたように、この規則はAIが生成したコンテンツに対して、機械的に検出可能な形での印付けを義務付けている。Anthropicはこの規則を定めた「行動規範(Code of Practice)」に署名しており、今回の透かし機能は、その公約を果たす形での実装ということになる。
対象となるのは、8月2日以降にリリースされたClaudeモデルだ。それ以前のモデルについても、今後数ヶ月かけて順次対応を進めていくとされている。適用範囲は、Claude本体だけでなく、Claude API、Claude Code、Claude Cowork、Claude Tag、さらにAWSやGoogle Cloud、Microsoft Foundry経由での利用も含む、Claudeが使われるあらゆる場面に及ぶ。
「単語選びのクセ」に統計的な印を刻む仕組み
この透かしの技術的な仕組みは、AIモデルがテキストを生成する基本的なプロセスに関わっている。大規模言語モデルは、一度に一語ずつ、次に来る単語を選びながら文章を生成していく。その選択の際、モデルは複数の候補となる単語の中から、文脈上最も自然なものを選び出す。
Anthropicの透かし技術は、この単語選びの過程に、暗号鍵に基づいた統計的な偏りをわずかに加える。人間の読者には全く感知できないレベルの偏りだが、その鍵を知っている検出システムであれば、生成されたテキスト全体を通じて、この統計的パターンの有無を確認できる。これはGoogle DeepMindが開発した「SynthID-Text」という技術の応用版であることが、8月14日に公開されたAnthropicの技術FAQで明らかにされている。
「コピペしても消えない」という特徴
この透かしの実務上重要な特徴は、テキストをコピー&ペーストしても、透かしがそのまま維持される点だ。透かしは、追加の文字や記号を挿入する形ではなく、単語そのものの選択パターンに組み込まれているため、テキストの中身自体が変わらない限り、透かしも残り続ける。
Anthropicは、この透かしが「品質、内容、読みやすさに実質的な影響を与えない」「余分なトークンを必要とせず、コストも増加しない」と説明している。また、透かしには特定の個人や組織、会話を特定できるような識別情報は含まれておらず、あくまで「このテキストがClaudeによって生成された可能性がある」ことを示すシグナルにとどまるという。
「翻訳」や「校正」にも透かしは付く
興味深いのは、この透かしの適用範囲が、ゼロから生成された文章に限らないという点だ。Anthropicの説明によれば、Claudeによる翻訳作業も、すべての単語がClaudeによって選ばれているため、透かしの対象になる。ユーザーがスペルミスを修正させただけの場合でも、修正された箇所には透かしが付与されうる。
これは、透かしの発動条件が「AIが文章をゼロから書いたかどうか」ではなく、「AIが単語の選択に関与したかどうか」という、より広い基準で判断されていることを意味する。
検出は「AIによる文体の癖」とは別物
Anthropicは、この透かしと、従来型のAI検出ツールとの違いについても明確に説明している。既存のAI検出サービスは、Anthropicの暗号鍵を持っていないため、透かしそのものを検出することはできない。その代わり、これらのサービスは、AIモデルが好んで使う言い回しの癖——例えば「これは単なるXではなく、Yだ」という構文や、「静かに(quietly)」という単語の頻出——といった、文体上の特徴を手がかりに判定を行っている。
透かしの検出は、これとは全く異なるアプローチであり、より確実性の高い判定を可能にする一方、あくまで「Claudeが処理した可能性がある」ことを示すに過ぎず、「これは絶対に人間が書いていない」という断定的な証明にはならない、という限界もある。
ファイルには別の仕組み——C2PAという業界標準
生成されたテキストとは別に、画像やSVGといったファイル形式のコンテンツに対しては、Anthropicは「C2PA」という、業界横断で採用が進むオープンな標準規格を使った、デジタル署名付きの来歴メタデータを付与する。ただし、こちらの仕組みは、ファイル形式の変換や再保存、スクリーンショットといった処理を経ると、痕跡が失われてしまう可能性があるとAnthropicは説明している。
エンジニアとして見ておきたいこと
Anthropicのあるエンジニアは、この透かしの限界について「完璧ではない、編集すれば消せる、しかしこれは第一歩だ」と率直に認めている。今後、テキスト検出用のAPIも一般公開される予定だとされており、開発者が自分のアプリケーション内で、この透かしを直接検証できるようになる見込みだ。
OpenAIやGoogleを含む、同じ行動規範に署名した他の主要AIラボも、それぞれ独自の透かし技術を実装していく方針だとされている。AI生成コンテンツの識別という課題に対して、業界全体が「完璧な解決策」ではなく「検出可能性を高める、いくつもの層を重ねたアプローチ」で臨もうとしていることが、今回のAnthropicの発表からも見えてくる。自社のプロダクトでClaude生成コンテンツを扱う開発者にとって、この透かしの仕組みと限界を正確に理解しておくことは、今後ますます重要になりそうだ。