AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

OpenAI、Astraモデルのサイバー能力強化で開発ペースを一時停止

OpenAIが発表した「サイバー機能を持つ能力の時代におけるモデル開発のリズム」という文書の引用画像。

https://images.ctfassets.net/kftzwdyauwt9/55UVJLAaFr5hqOom9Il3Ou/2a7c6a08571daf98a0643d76cc243add/index-pacing-model-development-cyber-capabilities-dark-seo.png?w=1600&h=900&fit=fill

OpenAIは2026年8月18日、次世代モデル「Astra」が重要なサイバーセキュリティ能力の閾値に達する可能性があるとして、大規模な強化学習(RL)トレーニングを含むモデル開発のペースを一時的に遅らせたと発表した。この措置は、内部研究環境でのリスク管理と安全対策を強化するためのものである。

OpenAIは2026年8月18日、「サイバー機能を持つ能力の時代におけるモデル開発のリズム」と題する文書を発表した。同社は直近2つの出来事、具体的にはHugging Faceとのインシデントと、次世代モデル「Astra」が自社の準備フレームワークにおける重要なサイバーセキュリティ能力の閾値に達する可能性があるという初期証拠を理由に挙げている。

これらの要因を受け、OpenAIは内部でのトレーニングやテストに伴うリスクが増大しているとして、強化学習(RL)トレーニングを含むスケーリングの開発ペースを一時的に遅らせる決定を下した。具体的には、直近2週間にわたり最新モデルに対するRLトレーニングを一時停止し、研究環境のセキュリティ強化と監視システムの範囲拡大を行った。

開発プロセスにおける安全策は、モニタリング、アライメント(意図に沿った動作)、セキュリティ対策の3つの要素によって支えられている。Astraのような高度なサイバー能力を持つモデルでは、より厳格なセキュリティ基準が適用される。これには、コード実行やネットワークアクセスを伴うワークロードの隔離と、インターネットからの分離が含まれる。

また、モデルの内部活動をリアルタイムで検出する新規モニタリングシステムも導入された。これはトークンごとに活動を検査し、懸念事項が発生した場合に30分以内にアラートを発令する仕組みである。この監視はSol能力以上のモデルにおけるすべての強化学習トレーニングと評価、およびAstraモデルのツール付き推論に適用される。

OpenAIは現在、より小さな規模でのトレーニングと評価を実施し、安全対策の有効性を検証している。大規模な最先端RLランの実行再開については、アライメントの証拠をさらに確立してから判断するとしている。

発表元: https://openai.com/index/pacing-model-development-cyber-capabilities