3.1415926535——この数列に新しい用途が生まれた。Anthropicの説明によると、Claudeが文章を生成する際、モデルは毎回「妥当な候補語」のリストから1つの単語を選ぶ必要があり、以前は乱数でそれを決めていた。今回透かし機能を導入したことで、Claudeは代わりに一組の「鍵」を使い、候補リストの何番目の単語を選ぶかを決めるようになった。公式が挙げた例がまさに円周率だ。鍵は「2」から読み始め、続く単語は順に候補リストの6番目、5番目、3番目、そして再び5番目の選択肢を取る。この過程で余計な隠し文字が残ることはなく、肉眼でも違いを読み取れない。解読できるのは、その鍵を握る者だけだ。
この手法は、Google DeepMindが『Nature』誌で発表したSynthID-Textという方式をAnthropicが改良したものだ。Anthropicは、透かしによって生成速度が落ちることはなく、追加のトークンも不要——つまり利用コストが上がることはないと強調している。これはEUの新たなAI透明性規則、すなわちAI生成コンテンツにはマーキングによる識別を可能にすることを求める規制への対応だ。Anthropicは今後、鍵を持つ人が特定の文章について「Claudeが関わったかどうか」を調べられるAPIを公開する予定だという。
検知できるのは「関与したかどうか」だけで、「どれだけ書いたか」ではない
透かしの限界についてもはっきりと述べられている。それは、この文章がClaudeが最初から書いたものなのか、それともユーザーが軽く手直しを頼んだだけなのかを区別できない。翻訳されたテキストも同様にマーキングされる。軽度の編集や文章が短すぎる場合、透かしは弱くなり検出できないこともある。しかし逆に言えば、軽度の編集では基本的に透かしを消せないということでもある。Anthropicは、本気で消したいなら文章全体を書き直す必要があると直言している。
プログラムコードは例外だ。Anthropicによると、コードの透かしは通常のテキストより弱くなりがちだという。理由は単純明快で、プログラミング言語はしばしば正確な出力を求められ、「候補語」があまり多くない。選択の余地がなければ、当然透かしも打ち込みにくくなる。これは現実的な問題にもつながっている——もし全体のコードがAI生成だと証明できれば、著作権上の懸念からそのままコピーして改変されるのではないか、という外部の懸念があったのだ。
画像については別のロジックが採用されている。Anthropicはメタデータに暗号署名付きの注記を加え、それがClaudeによって生成された画像であることを明記する。なぜEUで先行実装せず、世界中のユーザーに一斉展開するのかという点について、Anthropicは「地域ごとに分けて実装できる確証が今のところない」ためだと説明している。そのため、8月2日以降にリリースされるモデルには全面的に透かしを適用し、旧バージョンのモデルについては今後数か月かけて順次対応していくとしている。






