AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

LLMの電子透かしがAIエージェントの動作に影響を与えることが判明

Lasso Securityによる、電子透かしがLLMの出力に与える影響に関する調査結果の引用画像。

https://cdn.prod.website-files.com/677e57d57f0aaef07252db12/6aab8f3234c02c13abcd8f76_The%20Impact%20of%20%20LLM%20Watermarking%20%20on%20Agent%20Security%20%26%20Safety%20-%20744.png

Lasso Securityは2026年9月17日、LLM(大規模言語モデル)に導入される電子透かしが、モデルの回答拒否やAIエージェントのツール実行といった動作に変化をもたらす「サンプリング・ドリフト」を引き起こすと発表しました。これは、生成プロセスに介入する電子透かしの仕組みが、モデルの出力内容だけでなく、エージェントが実行するアクションの正確性にも関わることを示しています。

電子透かしによる動作の変化

Anthropic社がClaudeの出力に導入を進めているような、生成プロセスに組み込まれる電子透かしは、コンテンツの出所を証明するために設計されています。しかし、Lasso Securityの調査によれば、この技術はモデルが次の単語を選択するプロセス自体を変化させ、それがモデルの安全性やエージェントの挙動に影響を与えることが明らかになりました。

特にAIエージェントにおいては、電子透かしによって選択される単語が変わることで、呼び出すツールや、そのツールに渡される引数(命令の詳細)が変化するリスクがあります。これは、プロンプトインジェクションなどの攻撃を受けた際、モデルの拒否反応が弱まることと相まって、より深刻な影響を及ぼす可能性があります。

実証実験による影響の特定

Lasso Securityは、電子透かしの有無による動作の違いを検証するため、複数のモデルを用いて実験を行いました。その結果、ツール呼び出しの正確性が低下するケースが確認され、モデルや設定によってその傾向が異なることが判明しました。

実験では、電子透かしによって「正解が不正解に変わる」といった個別の判定の変化(churn)を測定しています。21のモデルと温度設定の組み合わせにおいて、この変化は平均6.5%に達しました。また、エラーの内容もモデルごとに異なり、引数の誤りや、形式が崩れた不正な出力が主な要因として挙げられています。

発表元: https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior