2026年8月11日、NVIDIAは長期間稼働するAIエージェント向けの専用モデル「Nemotron 3.5 Lightning」を発表した。30Bパラメータのうちアクティブに動作するのは3Bであり、多数の呼び出しや結果検証といった高頻度なタスクを低遅延で実行可能とする設計となっている。
2026年8月11日、NVIDIAは長期間稼働するAIエージェント向けの専用モデル「Nemotron 3.5 Lightning」を発表した。30Bパラメータのうちアクティブに動作するのは3Bであり、多数の呼び出しや結果検証といった高頻度なタスクを低遅延で実行可能とする設計となっている。
このモデルは、フロントエンドの複雑な計画立案を大規模モデルが担い、本モデルのような軽量モデルが高頻度な処理層を分担するシステム構成に最適化されている。Mixture-of-Experts(MoE)アーキテクチャを採用し、ルーターによって各トークンを少数の専門領域に振り分ける仕組みにより、大容量モデル級の処理能力を小規模な計算コストで実現している。
推論速度の向上には、複数のトークンを同時に生成するspeculative decodingと、NVFP4形式の量子化技術が採用されている。これらにより、同規模の他モデルと比較して最大4倍の出力速度を実現した。評価ベンチマークでは、類似精度を維持しつつタスク完了までの時間を30%短縮する性能を示している。
開発者はLoRAやSFTによるファインチューニング、強化学習によるカスタマイズが可能である。OpenMDW-1.1ライセンスの下でモデルの重み・学習データ・レシピが公開されており、NVIDIA NeMo Switchyardを用いてタスクの難易度に応じて最適なモデルへリクエストを振り分ける構成もサポートされている。
対応ハードウェアはデスクトップからデータセンターまで幅広く、DGX SparkやGeForce RTX 5090などのローカル環境でも動作する。OllamaやLM Studioといった標準的な推論ツールとの互換性も確保されている。
