ニュースリリースを伝えるニュースサイト

Anthropic、Claudeの不正転移学習攻撃を3社で確認

,
Anthropicによる不正転移学習攻撃に関する発表内容を示す、公式リリースの引用画像。

https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks

Anthropicは2026年2月23日、DeepSeek、Moonshot AI、MiniMaxの3社によるClaudeの能力抽出キャンペーンを検出したと発表しました。これら3社は不正アカウントを通じて1,600万回以上のやり取りを行い、転移学習手法を用いて自社のモデル改善を図った疑いがあります。

発見された攻撃の実態

Anthropicは2026年2月23日、DeepSeek、Moonshot AI、MiniMaxの3社によるClaudeの能力抽出キャンペーンを検出したと発表しました。これら3社は不正アカウントを通じて1,600万回以上のやり取りを行い、転移学習手法を用いて自社のモデル改善を図った疑いがあります。

攻撃は「転移学習」と呼ばれる手法を用いました。これは強力なモデルの出力を学習データとして扱い、より小さなモデルに知識を圧縮する一般的な技術です。Anthropicによれば、この技術は通常、自社モデルの小規模版を作成するために利用されますが、今回は競合他社がClaudeの高度な機能を短時間・低コストで獲得することを目的とした不正利用でした。

各社の攻撃範囲と特徴は異なります。DeepSeekは15万回以上のやり取りを行い、推論能力やコンテンツフィルタリング回避策の抽出を試みました。Moonshot AIは340万回以上、Claudeのコーディング機能やツール使用能力の抽出を行いました。MiniMaxは1,300万回以上、特にエージェント型コーディングとツールの使用に焦点を当てた攻撃を実施しました。

技術的な回避手法

これらの企業は、Claudeへのアクセスを制限されている地域からの利用を可能にするため、商業プロキシサービスを利用しました。Anthropicはこれを「ヒドラクラスター」と呼んでいます。これは不正アカウントを大量に作成し、APIとサードパーティクラウドの両方に分散してトラフィックを送るネットワーク構造です。

攻撃パターンは通常のユーザー使用とは異なり、高度に構造化された大量のプロンプトが送られました。AnthropicはIPアドレスの相関やリクエストメタデータを通じて各キャンペーンを特定し、一部のケースでは業界パートナーからの情報提供も得たとしています。

懸念される影響

Anthropicは、不正な転移学習によって生成されたモデルには安全保障機能が欠如しているため、国家安全保障上の重大なリスクにつながると警告しています。これらの機能は軍事や諜報活動への悪用、大規模監視に利用される可能性があります。

また、この攻撃は輸出管理規制の回避にもつながります。Anthropicは、中国におけるClaudeの商業提供を停止していますが、プロキシサービスを通じてアクセスが制限されています。これにより、輸出管理規制が効果的に機能しているという誤った認識が生じる恐れがあります。

今後の対応

Anthropicはこの問題に対し、業界全体、政策立案者、グローバルなAIコミュニティによる迅速で協調的な対応が必要だと強調しています。攻撃の規模と巧妙さは増しており、単一企業や地域の問題ではないとしています。

発表元: https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks