AWSは2026年8月17日、Amazon SageMaker JumpStartにてNVIDIAの軽量モデル「Nemotron 3.5 Lightning」の利用を開始した。同モデルはエージェントワークロード向けに最適化され、単一GPUでの実行と高スループットを実現する。
AWSは2026年8月17日、Amazon SageMaker JumpStartにてNVIDIAの「Nemotron 3.5 Lightning」の利用を開始した。同モデルはエージェントワークロード向けに最適化され、単一GPUでの実行と高スループットを実現する。
このモデルは、NVIDIA Nemotron 3 Ultraを蒸留して開発されたオープンな基盤モデルである。ハイブリッドMixture-of-Experts(MoE)アーキテクチャを採用し、総パラメータ数は30Bだが、推論時にアクティブになるのは3Bのみである。これにより、単一の対応GPUで動作可能となり、最先端レベルのインフラを必要とせずとも、反復的で専門的なエージェントワークフローを実行できる。
パフォーマンス面では、NVIDIAによると高負荷のエージェントワークロードにおいて最大4倍のスループット向上と、タスク完了が最大30%高速化されるという。また、DFlashという推測デコーディング技術によりトークンあたりのレイテンシを低減し、1Mトークンのコンテキスト長を持つため、長時間にわたるセッションでも状態の維持が可能である。
SageMaker JumpStartからの展開では、推論インフラを手動で構成する手間が省ける。NVFP4およびBF16の2つのバリアントから選択でき、SageMaker StudioやHugging Faceのモデルページ、Python SDKを通じてデプロイできる。ユーザーは独自のドメインデータで後期訓練を行い、結果となる重みを引き続き所有・管理できる柔軟性も備えている。
