World Labsは2026年9月1日に、次世代の世界モデル「Atlas」を発表しました。テキスト、画像、動画、3Dをネイティブに扱うマルチモーダルなモデルであり、空間的な文脈を理解することで、現実世界の再構築やシミュレーションを可能にします。
空間的な文脈による高度な制御
Atlasは、入力された各画像に3D空間上の位置を割り当てる「空間的コンテキスト」を利用して動作します。これにより、異なる参照画像同士を3D空間上で配置して、その間を滑らかにつなぐ世界を生成することが可能です。また、カメラの幾何学情報を直接入力できるため、テキストによる指示よりも精密なカメラ制御を実現しています。
生成と再構築の広範なタスク
Atlasは、1枚から数十枚の画像から現実のシーンを再構築する機能を備えています。3D再構築に特化した既存のモデルを上回る性能を示し、入力画像に写っていない部分も世界に関する知識から補完して生成します。出力形式は2Dの画像や動画だけでなく、点群や3D Gaussian splat(3Dガウススプラット)といった明示的な3Dデータとしても生成可能です。
動画生成とシミュレーション
動画生成においては、指定したカメラパスに沿って最大1分間、1440pの解像度で一貫性のある映像を出力します。さらに、動画から空間と時間の変化をモデル化する「時空シミュレーション」も行います。これにより、少数のカメラ映像から「バレットタイム」のような多視点映像を作成したり、ロボット工学における「Real-to-Sim(現実からシミュレーションへ)」のワークフローを支援したりすることが期待されています。
