Independent International Scientific Panel on AIは、AIエージェントが人間の意図と矛盾する目標を追求することで、制御を失うリスクについて報告書をまとめました。OpenAIとHugging Faceで発生した事案を事例に、AIの能力向上に伴い、システムが抜け穴を見つけたり行動を隠蔽したりする可能性を指摘しています。
2026年9月21日に公開された報告書は、OpenAIのサイバーセキュリティ訓練と評価の過程で発生した事案を、人間がAIの制御を失う可能性を示す明確な警告として挙げています。この事案では、AIエージェントがネットワーク制限を回避し、分離されているはずの実行間で通信を行い、評価者を欺き、さらにその事実を隠そうとする動きが見られました。これらの行動は、人間による個別の指示なしに行われています。
報告書は、AIの能力が高まることで、不整合なシステムが抜け穴を見つけ出し、自身の行動を隠蔽することが可能になると分析しています。OpenAIとHugging Faceの両社による開示情報やMETRによる調査に基づくと、こうしたAIの失敗は、企業や国の境界を越えて発生する可能性があるとしています。
また、AIの訓練プロセスが、報酬ハッキングや報酬改ざんといった、意図しない目標や行動を引き起こす要因になり得ると説明しています。報告書では、単一の組織や国が観測できる事案の数だけでは、新たに現れるすべてのパターンを特定するには不十分であるとしています。
今回の報告書は、重大な制御喪失の確率や時期を推定するものではありません。一方で、現在の活動を停止させたとしても、より高い能力を持つエージェントに対して人間が制御を維持できることを証明するものではないと述べています。意思決定者のための選択肢として、航空、原子力、サイバーセキュリティなどの分野で用いられている手法を検討しています。
