Anthropicが、Claudeの生成テキストへ「人には見えない電子透かし」を入れる方針を明らかにしました。きっかけとしてはEU AI法への対応ですが、対象はEUだけではありません。日本を含む全世界で、Claude本体、API、Claude Codeなどへ適用されます。

ただし、「今日からClaudeの全出力に透かしが入り、AIが書いた文章を見破れるようになった」と理解するのはあまり正確ではありません。

対象は対応モデルです。2026年8月2日以降にEUで投入される新モデルは提供開始時から対応し、それ以前の既存モデルは移行作業中とされています。埋め込み方式や検出ツールも、現時点では公開されていません。

そして、もっと重要なポイントがあります。透かしが見つかっても、Claudeが文章を書いた証明にはなりません。Anthropic自身が、人間の原稿を校正、翻訳、要約した場合にも印が付く可能性を明記しているからです。

この点は、例えば大学などの教育機関でのAI利用を見抜く作業に大きな影響を与え、特に「誤認識」が拡大する可能性がある、と考えています。AI生成物を識別する技術の話に見えて、実際には「人とAIが一緒に作った文章を、誰の仕事として評価するのか」という問題を含んでいる、と思いました。

透かしが証明するのは、著者ではなく「Claudeを通った可能性」

Anthropicは二つの方法を使います。

一つは、テキストそのものへ織り込む、人には知覚できない透かしです。コピー&ペーストしても一緒に移り、一部の編集を経ても残る可能性があると説明されています。

もう一つは、PNG、JPEG、SVGなどの対応ファイルへ付ける、C2PA準拠の署名付き来歴情報です。こちらは、ファイルがClaudeで処理されたことや、その後に改変されたかを確かめるためのメタデータです。ただし、再保存、形式変換、スクリーンショットなどで失われる場合があります。

どちらも完全な身元証明ではありません。

テキストから透かしが検出されても、元の発想や原稿が人間のものか、Claudeがゼロから作ったのかは区別できません。その後にどれだけ人が書き直したのかもわかりません。

反対に、透かしが見つからなくても、AIを使っていないとは断定できません。短文、旧モデル、大幅な編集、翻訳、ほかの文章との混在などで、信号が弱まる可能性があるためです。

しかし、EU AI法は単純な校正を除外している

導入の背景は、2026年8月2日に適用が始まったEU AI法第50条です。生成AIのプロバイダーは、生成・加工したテキスト、画像、音声、動画へ、機械が読み取れる印を付け、人工的に生成・加工されたことを検出可能にする必要があります。

ここだけを読むと、Anthropicの全面的な対応は当然に見えます。しかし第50条には重要な例外があります。AIが標準的な編集を補助するだけの場合や、入力データや意味を実質的に変えない場合には、マーク付与義務を適用しないと定めています。

欧州委員会の説明でも、スペルチェック、文法修正、意味を変えない軽い文体調整は、標準的な編集の例に含まれます。翻訳も、入力の意味を実質的に変えない範囲なら例外に該当。一方、要約や構成・意味を変えるリライトは別、という扱いです。

ところが、Anthropicのサポート文書は、対応モデルが生成する「すべてのテキスト」へ、モデルレベルで透かしを付けると説明しています。少なくとも公表文の通りであれば、EU AI法が義務付ける範囲より広いを示しています。

これが法令違反という意味ではありません。企業が法定範囲より広く透明性対策を取ることはできます。ただ、その追加コストを誰が負うのか?そしてそもそも、AIで作成された文章が、本当に検出しなければならないものなのか?という点は検討が必要です。

見えない文字を消せば済む、とは確認されていない

「透かし」と聞くと、ゼロ幅スペースなどの不可視Unicode文字が文章の中へ混ぜられる姿を想像します。実際、発表直後から、それらを取り除くとうたうツールも現れました。

しかし、Claudeがその方式を使うと確認できる資料は、現状ありません。Anthropicは具体的な実装をまだ公表していません。

LLMのテキスト透かし研究の最前線をのぞいてみると、文字を追加する代わりに、生成時の単語やトークンの選び方へ統計的な癖を持たせる方法が試されてきました。

代表的なKGW方式では、秘密鍵と直前の文脈から候補語を二群に分け、一方を少し選ばれやすくします。一語ではわかりませんが、長い文章で選択の偏りを調べると、偶然では説明しにくい信号が現れます。

Google DeepMindのSynthID-Textも、生成時のサンプリングへ信号を組み込む系統です。Natureに掲載された研究では、Geminiの約2000万件の応答を使った実運用実験で、テキスト品質を維持できたと報告されています。

現段階で、Claudeがこれらと同じ方式を使うとは限りません。不可視文字説も、特定の統計方式だという説明も未確定であり、技術文書を待つ必要があるということです。

大問題:善意の利用者には残り、欺こうとする人は消そうとする

大学のレポートでもあるあるかもしれませんが、善意のある学生はAI利用や参考文献などを明記し、コピペして済ませようとする学生は、そうしたものを書きません。もちろん、前者は評価しますし、後者は参考文献の明記を求めることになります。

電子透かしも同様に、難しい非対称性があります。

人間が自分で書いた文章をClaudeで校正し、そのまま提出した場合、透かしが残る可能性があります。AIを使った事実を隠そうとしていない、通常の使い方です。

一方、最初からAI利用を隠そうとする人は、大幅な改稿や別の処理によって信号を弱めようとします。Anthropic自身も、強い言い換え、翻訳、文章の混合などで検出できない場合があると認めています。2023年以降の研究でも、言い換えによって各種AIテキスト検出を回避できる問題が示されてきました。

すると、悪用を正確に見つける装置ではなく、透かしを残した利用者を見つける装置になる可能性があります。これは、特に提出されたテキストを評価する場面において、含めなければならない認識だ、と思います。

日本のXの公開検索で確認できた範囲では、この点に反応が集まりました。

AI小説家のITnavi氏(@itnavi2022)は、自分で書いた文章をAIで推敲しただけで「AI生成」と判定されることは受け入れがたいと投稿しています。論文や原稿の英文校正にLLMを使う研究者からは、非英語母語話者を不利にするのではないか、という懸念も出ました。

https://x.com/itnavi2022/status/2087300588530983202

一方、ニュース紹介系の投稿では、透明性向上への期待も見られます。技術者の間では、単純な不可視文字ではなく、統計的な透かしの仕組みと限界を理解しようとする解説が共有されています。

日本語圏の反応は、透かしへの全面反対ではありません。AI生成物の透明性は必要だと理解しながら、校正や翻訳まで「AIが書いた」と一括りにされることへ警戒しているのです。

そもそもの話、このテキストは、松村が原案を考えて書き、AIに整えさせました。おそらく透かしが入っているでしょう。自分にとっては良い整理ができたな、と思っていますが、これは悪いことなのでしょうか?

学校や企業は、検出結果だけで不正を認定してはいけない

この電子透かしが実装されると、最初に判断を迫られるのは、学校、大学、出版社、メディア、企業の採用・評価部門でしょう。

ここで必要なルールは明確です。

  • 透かしの検出を、AIによる代筆や不正の単独証拠にしない
  • 透かしがないことを、人間だけで書いた証明にも使わない
  • 原稿の版履歴、調査メモ、引用元、AIを使った工程、人間による確認内容を合わせて評価する
  • 不利益な判断をする場合は、本人が説明し、判定へ異議を申し立てられる手続きを置く

書き手側も、「AI避け」だけを対策にする必要はありません。自分で作った初稿、変更履歴、参照資料、ファクトチェックの記録を残せば、人間がどこに責任を持ったかを説明できます。

透かし除去ツールへ文章を投入することは勧められません。Claudeの方式に効くと確認されていないうえ、原稿を第三者サービスへ渡す情報管理上のリスクが増えるからです。

次に見るべきは、検出精度より「判定に異議を唱えられる設計」

Anthropicは今後、技術文書と検出手段を公開するとしています。確認すべき点は五つあります。

第一に、どのモデル、製品、言語、文章量が対象か。

第二に、日本語を含む言語別の検出精度と誤検出率。

第三に、校正、翻訳、要約、全面生成を区別できるか。

第四に、誰が検出器へアクセスでき、判定の信頼度をどう示すか。

第五に、誤った利用や判定に対し、当事者が訂正を求められるかです。

電子透かしは、AI生成物の透明性を高めるための有力な部品です。しかし、部品が一つ増えただけでは、信頼できる仕組みにはなりません。

必要なのは「AIがいた」という一ビットの印だけではありません。AIがどの仕事を担い、誰が内容を確かめ、誰が公開責任を持ったのか。人とAIの共同作業が普通になるほど、その文脈を残す仕組みの方が重要になります。

出典・関連資料