2026年8月21日、NVIDIAは自律型エージェント用アーキテクチャ「AVO」について発表した。同システムが対話推論ベンチマーク「ARC-AGI-3」の全環境で満点となる100点を記録したことを明らかにし、汎用的な長期自律作業の基盤として機能することを実証した。
NVIDIAは、大規模言語モデルを取り巻くシステム層に着目したエージェントアーキテクチャ「Agentic Variation Operators(AVO)」を公開した。この発表では、AVOが対話推論ベンチマークであるARC-AGI-3で100点のスコアを達成した事実と、その背景にある設計思想が説明されている。
長期自律作業を支える仕組み
AVOはコードの編集やコマンド実行に加え、長時間にわたる自律的な稼働に重点を置いている。GPUカーネル最適化の実験では7日間にわたり継続して動作し、500以上の最適化方向性を探索した実績がある。
この長期作業を支える主要な要素として、永続メモリとスーパーバイザーの2つが挙げられている。永続メモリにより、過去のコードや評価結果、コンパイラ出力を保持し、状態から再開できる仕組みとなっている。またスーパーバイザーは停滞を検知して戦略の方向転換を図る役割を果たす。
異なるタスクへの汎用性
今回のARC-AGI-3での成果は、AVOが特定のドメインに限定されないことを示している。このベンチマークでは、指示やルールのない未知の環境でエージェントが自律的に推論し、行動する必要がある。
NVDAはAVOを構成する基盤を変更せずにタスクインターフェースのみを変更して適用した。その結果、183レベルの全タスクを完了し、相対的ヒューマンアクション効率(RHAE)で満点となった。この出来事はモデル自体の評価とエージェントシステムとしての評価が異なることを浮き彫りにしている。
実装の特徴
ARC-AGI-3への適用にあたり、AVOはテキストのみのモーダリティを採用した。画像ではなく64×64のテキストグリッドで観察情報を提供し、ゲームのルールやゴールの説明なしにエージェントが行動の効果を推測する構成とした。これにより、ドメイン固有の知識ではなく、自律的に進捗を維持するための仕組みそのものが有効であることを検証している。
