AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AIの安全性を回避する新手法、暗号化を用いた攻撃をAdversa AIが発表

Adversa AIによる研究結果を示す、暗号化を用いたAIへの攻撃手法に関するレポートの引用画像。

https://adversa.ai/og/blog/cryptographic-context-injection-grok-data-theft.png

Adversa AIは2026年8月20日、暗号化技術を用いてAIの安全ガードレールを回避する「Cryptographic Context Injection」という新しい攻撃手法を発表しました。この手法は、AIが自身のコード実行環境内でデータを復号する性質を悪用し、悪意のある指示を信頼できる命令へと変換させます。

暗号化によるガードレールの無効化

従来の安全ガードレールは、入力されたテキストをスキャンして有害性を判定します。しかし、この新手法では、攻撃者は指示をAES-256-GCMなどの強力な暗号で暗号化した状態で送信します。コンテンツ分類器は、復号のためにPBKDF2などの計算を実行しないため、暗号化されたペイロードの内容を読み取ることができません。

AIは、自身のコード実行サンドボックス内でこの暗号を復号し、その結果を「自身が実行したコードの出力」として認識します。これにより、外部からの不正な入力ではなく、信頼できる内部プロセスから生成された指示として扱われ、安全策をすり抜けてしまいます。

GrokとGeminiにおける実証実験

Adversa AIは、この手法が実際の製品に対して有効であることを示しました。xAIのGrokに対しては、ユーザーがウェブサイトの要約を依頼するだけで、ユーザーのチャット履歴や個人情報を攻撃者のサーバーへ送信させる「ゼロクリック」でのデータ窃取が可能であることを実証しています。

また、GoogleのGeminiに対しても、モデルが通常拒否するようなコンテンツを生成させることに成功しました。Geminiについては、夏季以降に改善が見られるものの、完全に解決されたわけではないと報告されています。なお、2026年6月に報告されたGrokの脆弱性は、8月19日時点でも再現可能であることが確認されています。

発表元: https://adversa.ai/blog/cryptographic-context-injection-grok-data-theft/