NVIDIAはAIエージェントの知覚と推論プロセスを、テキスト・画像・音声・動画を統合した単一のオープンモデル「Nemotron 3 Nano Omni」に集約した。従来必要だった複数のモデルチェーンを置き換えることで、推論コストの削減とオーケストレーションの複雑さ軽減を目指す。
エージェントシステムは通常、画面や文書、音声、映像、テキストに対する判断を単一の知覚から行動へのループで実行する必要があるが、現状では視覚・音声・言語用に個別のモデルスタックを組み合わせている。この断片的な構成は推論ホップを増やし、オーケストレーションの複雑さを招くため、コスト増とマルチモーダル文脈の一貫性低下を招いていた。
NVIDIA Nemotron 3 Nano Omniは、こうした断片的な視覚・言語・音声スタックに代わるものとして開発された。同モデルはエージェントシステムにおけるマルチモーダル知覚とコンテキストのサブエージェントとして機能し、視覚・音声・テキスト入力に対する知覚と推論を単一の共有ループ内で実行可能にする。これにより収束性が向上し、オーケストレーションの複雑さと推論コストが削減される。
精度面では、MMlongbench-DocやOCRBenchV2などのドキュメントインテリジェンスリーダーボードで最高クラスの性能を発揮するほか、WorldSense、DailyOmni、VoiceBenchにおける動画・音声理解でも首位を獲得している。また、メディアデータと生産タスクに基づいて品質・コスト・スループットを評価するオープンベンチマークMediaPerfでは、動画レベルのタグ付けにおいて最低の推論コストを達成している。
モデルは30B-A3Bのハイブリッド混合专家(MoE)アーキテクチャを採用。タスクやモーダルに応じて必要なエキスパートのみを起動することで、高いスループットと強固なマルチモーダル性能を維持する。重み・データセット・レシピは完全に公開されており、開発者はローカル・クラウド・エンタープライズ環境にマルチモーダルサブエージェントをカスタマイズして展開できる。
NVIDIA Ampere、Hopper、Blackwellの各GPUファミリーおよびvLLMやTensorRT-LLMなどの推論エンジンに対応し、FP8やNVFP4量子化もサポートする。これによりワークステーションからデータセンター・クラウドまで、低遅延で予測可能な推論を実現する。
固定されたインタラクティブ性閾値を基準とした評価では、動画 reasoning とマルチドキュメント reasoning の両方で、代替オープンオムニモデルと比較してそれぞれ最大約9.2倍、7.4倍の有効システム容量を維持している。Blackwell GPU上でのNVFP4量子化は、複雑な文書処理や長時間の推論、大規模動画バッチなどエンタープライズワークロードにおいて最高スループットを示す。
