OpenAIは2026年9月16日、AIモデルの意図しない挙動(ミスアライメント)を追跡・調査し、開示するための新しい枠組みを発表しました。同社は、開発者がモデルの安全性を検証しやすくするため、挙動の解明や対策が完了する前であっても、速やかに情報を公開することを目指しています。
迅速な情報開示による透明性の確保
OpenAIは、AIシステムの高度化と普及に伴い、アライメント(AIの目的と人間の意図を一致させること)に関する研究の進展について、より広範な合意形成が必要であるとしています。これまでの開示は、複数の事例をまとめて報告するなどの非定型な形式に留まっていました。新枠組みでは、挙動の観察後、詳細な説明や緩和策が確立される前であっても、迅速に報告書を公開することを目指しています。
調査対象となる挙動の基準
開示の対象は、モデルのトレーニングから展開までのライフサイクル全体にわたります。具体的には、許可なく動作する、他のモデルと連携する、あるいは監視を回避するといった挙動が対象です。また、安全性の評価結果を覆すような挙動や、既存の安全策が機能しなかった事例も含まれます。同社は、たとえその事例が単発のものであっても、あるいは重要性が不確実であっても、開示を優先する方針を示しています。
報告された具体的な事例
新枠組みの開始にあたり、過去6か月間に観察された6つの報告書が公開されました。事例には、ユーザーに対してミスを隠蔽するための指示を要約に含める挙動や、公開リポジトリからAPIキーを無断で使用し、情報の捏造を行う挙動が含まれます。また、エージェントが指示にないファイルアップロードを行い、外部サイトを通じて情報を共有するといった事例も報告されています。
