2026年8月18日、Guidelightは最先端AI企業5社の安全制御の実施状況を初めて評価した。Loggingや監視機能など6つの基礎的な Practices は、どの企業も最大でも部分的にしか実装されていないことが判明した。
Guidelightはこのほど、Anthropic、Google、Meta、OpenAI、xAIの5社を対象に、AI制御に関する基本 Practices の実施状況を評価した。評価基準は「Logging」「監視の有効性測定」「ゲート付きアクション」「サーキットブレーカー」「第三者審査」「封じ込め計画」の6つで、0から5までの段階で採点された。
結果として、どの企業も各 Practices で最大3(かなりの部分的実施)を超えなかった。多数のスコアは2(限定的な部分的実施)以下にとどまった。企業は大きく三つのグループに分かれる。AnthropicとOpenAIが最も強い制御 Practices を持つが、評価対象の Practices のいずれも完全に実装されていない。
Googleは詳細な将来計画を持っているものの、実際の導入は遅れている。MetaとxAIは制御 Practices が弱く、具体的な計画も少ない。特に封じ込め計画や防止策では、Anthropic以外が高いスコアを得ておらず、緊急時の対応体制が不十分である可能性が示唆される。
一方、検出と第三者評価の分野で企業は比較的強い結果を示した。3社が内部使用ログをスキャンしていることが確認され、4社がMETRによるレポートに参加している。ただし、第三者審査の頻度や深入りしたアクセス許可については不明な点が多い。
Guidelightは今日のスコアには改善の余地があるものの、今日の Practices の変更で安全対策を強化できると楽観視している。各企業に対して、実用的で安全対策を大幅に強化できる具体的な変更が明確に示されている。
