NVIDIAは2026年9月16日、MLPerf Inference v6.1における最新システム「NVIDIA Vera Rubin NVL72」のプレビュー結果を発表しました。同システムは、従来のGB300 NVL72と比較して大幅なスループットの向上を実現しています。
Vera Rubinによるスループットの大幅な向上
Vera Rubin NVL72は、MLPerf Inferenceのプレビュー提出において、GB300 NVL72を上回る性能を示しました。Qwen3-VLを用いたテストでは、オフライン、サーバ、インタラクティブの各シナリオにおいて、GB300 NVL72より最大3.7倍高いスループットを記録しています。また、DeepSeek-R1を用いたテストにおいても、GB300 NVL72より最大2.5倍高いスループットを達成しました。
この性能向上は、ハードウェアとソフトウェアの共同設計によるものです。Vera Rubinの強化されたTensor CoreとTransformer Engineが、推論のプリフィルおよびデコードの両ステージを加速させます。さらに、NVFP4精度の採用により、出力品質を維持したままメモリ使用量を削減し、スループットを向上させています。
高いスケーリング効率とソフトウェアの最適化
GB300 NVL72は、大規模な構成においても高い効率性を維持しています。288個のGPUを搭載した4ラック構成のDeepSeek-R1のテストでは、99%のスケーリング効率を達成しました。これは、ハードウェアを追加した際にスループットがほぼ線形に増加していることを示しています。
また、継続的なソフトウェアの最適化も性能向上に寄与しています。MLPerf Inference v6.1への提出において、GB300 NVL72はv6.0と比較して最大1.6倍の性能向上を実現しました。この向上は、KVキャッシュの精度低下やカーネルの融合、分散サービングといった最適化によってもたらされています。
