Amazon Web Servicesは2026年9月4日、NVIDIA Cosmos 3とAmazon SageMaker HyperPodを活用して、物理AIモデルファクトリーを構築する方法を示すブログを公開しました。ロボットや自動運転車などの物理AI開発に必要な、合成データの生成からモデルの評価までを継続的に行うパイプラインの構築について解説しています。
単一のモデルアーキテクチャによる開発の効率化
物理AIの開発には、合成データの生成、知覚および方策モデルのポストトレーニング、そしてシミュレーションによる評価という継続的なループが必要です。従来、これらの各ステージには個別のGPUリソースを割り当てていました。しかし、NVIDIA Cosmos 3は、ビデオ、画像、アクション、音声を単一のトークンストリームとして扱う設計を採用しています。これにより、同一のモデルファミリーを用いて、生成、ポストトレーニング、評価の各ステージを単一のGPUノードプール上でスケジュール実行することが可能になります。
Cosmos 3の技術的特徴
Cosmos 3は、Mixture-of-Transformers(MoT)設計を採用しており、各レイヤーで推論を行うReasonerと、ビデオやアクションを生成するGeneratorの2つのエキスパートが結合されています。この設計により、生成プロセスがすべてのレイヤーで推論結果に基づいたものになります。また、推論時にはビデオのデコードをスキップするなど、トレーニング時とは異なる動作を行う非対称な設計も取り入れられています。
3つの動作モード
Cosmos 3は、入力されるデータのノイズ状態を変えることで、3つの異なるモードとして機能します。1つ目は、合成ビデオを生成する「Forward dynamics(世界モデル)」、2つ目は、ビデオからアクションラベルを生成する「Inverse dynamics(アクションラベルラー)」、3つ目は、ロボットの動作を出力する「Policy(デプロイ用ロボット)」です。これら3つのワークロードを、Amazon SageMaker HyperPod上で実行する手法が示されています。
