2026年8月24日、NVIDIAはVera Rubin NVL72システムの測定済みパフォーマンスデータを発表した。エージェントワークロードにおいてGB300 NVL72比で1ワットあたりのスループットが最大30倍向上し、トークンコストも最大35倍低減するとしている。
エージェントAIのワークロードはチャットや要約と異なり、ステップを重ねるごとにコンテキストが蓄積し、入出力トークン数が数十万単位に達する場合がある。こうした長文脈処理を効率的に実行するには、インフラストラクチャが膨大なトークン需要に対応できる必要がある。
NVIDIAはSemiAnalysis AgentXワークロードを用いて、実際のエージェントコーディングセッションの記録に基づく測定を実施した。その結果、Vera Rubin NVL72はGB300 NVL72と比較して1ワットあたりのスループットが最大30倍向上することが示された。これにより、同じエネルギー消費量で30倍のエージェントワークロードを処理可能になる。
また、トークンコストの観点からも優位性がある。Vera Rubin NVL72はGB300 NVL72に対し、1Mトークンあたりのコストが最大35倍低減するとしている。電力制約のあるAIファクトリにおいて、ワットあたりのスループットとトークンコストは収益性と利益率に直結する要素である。
この性能向上の背景には、プラットフォーム全体の極限的な協調設計がある。コンテキスト処理と応答生成を分離して独立させる分散サービングや、KVキャッシュの分散管理による重複計算の削減など、エージェントAI特有の最適化が実装されている。さらに、NVLink 6スイッチは既存のエーテル網と比較してパケットレートで10倍、レイテンシで3分の1の性能を提供する。
Vera Rubin NVL72は現在フル生産段階にあり、エコーシステム全体でスケーリングが進んでいるとNVIDIAは説明している。
