AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

NVIDIA Vera Rubin NVL72、エージェントAIで1Mトークンあたり35倍低コスト

,
NVIDIA Vera Rubin NVL72の性能向上を示す、GB300との比較データを含むグラフ。

https://blogs.nvidia.com/wp-content/uploads/2026/08/end-to-end-tech-blog-agentic-perf-kv-1920×1080-5555700.jpg

2026年8月24日、NVIDIAはVera Rubin NVL72システムの測定済みパフォーマンスデータを発表した。エージェントワークロードにおいてGB300 NVL72比で1ワットあたりのスループットが最大30倍向上し、トークンコストも最大35倍低減するとしている。

エージェントAIのワークロードはチャットや要約と異なり、ステップを重ねるごとにコンテキストが蓄積し、入出力トークン数が数十万単位に達する場合がある。こうした長文脈処理を効率的に実行するには、インフラストラクチャが膨大なトークン需要に対応できる必要がある。

NVIDIAはSemiAnalysis AgentXワークロードを用いて、実際のエージェントコーディングセッションの記録に基づく測定を実施した。その結果、Vera Rubin NVL72はGB300 NVL72と比較して1ワットあたりのスループットが最大30倍向上することが示された。これにより、同じエネルギー消費量で30倍のエージェントワークロードを処理可能になる。

また、トークンコストの観点からも優位性がある。Vera Rubin NVL72はGB300 NVL72に対し、1Mトークンあたりのコストが最大35倍低減するとしている。電力制約のあるAIファクトリにおいて、ワットあたりのスループットとトークンコストは収益性と利益率に直結する要素である。

この性能向上の背景には、プラットフォーム全体の極限的な協調設計がある。コンテキスト処理と応答生成を分離して独立させる分散サービングや、KVキャッシュの分散管理による重複計算の削減など、エージェントAI特有の最適化が実装されている。さらに、NVLink 6スイッチは既存のエーテル網と比較してパケットレートで10倍、レイテンシで3分の1の性能を提供する。

Vera Rubin NVL72は現在フル生産段階にあり、エコーシステム全体でスケーリングが進んでいるとNVIDIAは説明している。

発表元: https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/