OpenAIは2026年9月22日に、独立した第三者機関による安全性評価における優先事項と原則を公表しました。同社は、モデルのトレーニングから展開に至るまでのプロセスにおいて、外部機関が深いレベルのアクセス権を持ち、安全性の主張を検証できる環境を支援するとしています。
OpenAIは、独立した第三者機関が技術的な安全性評価を行う際、以下の4つの優先領域に焦点を当てることを提案しています。
安全性の主張とケースの検証
第一の優先領域は、トレーニング、評価、内部および外部への展開にわたる「安全性ケース(Safety case)」の独立した評価です。安全性ケースとは、モデルのリスクが適切に管理されていることを、証拠に基づいて説明する構造化された議論を指します。これには、アライメントやサイバーセキュリティ、生物・化学的悪用の防止といった専門知識に基づく検証が含まれます。
安全策の評価
第二の優先領域は、モデルレベルやセキュリティレベルを含む、多層的な安全策(Safeguards)の評価です。これには、モデルの能力向上に伴うリスクや、サイバー防御システムとの相互作用、アライメント監視の信頼性などが含まれます。評価には、敵対的なテスト(ジェイルブレイク)などに対する堅牢性を確認するための「グレーボックス」的なアクセスも想定されています。
特定のリスクカテゴリに関する評価
第三の優先領域は、化学・生物学的リスク、サイバーセキュリティ、AIの自己改善といった「Preparedness(準備態勢)」のリスクカテゴリに関連する能力評価です。また、深刻なアライメントの不一致(Misalignment)のリスクを評価するための検証も含まれます。これらは、モデルが能力の閾値を超えた際に、評価内容を継続的に更新し、高度な能力を測定できるようにすることを目的としています。
