Googleはロボット用の高レベル推論モデル「Gemini Robotics ER 2」を発表した。リアルタイムの映像理解とマルチエージェント連携により、ロボットのタスク遂行精度と安全性が向上する。
リアルタイム推論でロボットを制御
Googleはロボットの高レベル思考役となる「Gemini Robotics ER 2」を発表しました。このモデルは人間との会話や物理世界の理解に加え、複数ステップのタスク計画を行います。計画後は低レベルのVision-Language-Action(VLA)モデルに実行を委譲します。Google検索などのツール呼び出しにも対応し、行動しながら次の思考を進める設計です。
進化した映像理解とマルチロボット連携
前世代と比較して、継続的な映像フィードによる自己進捗追跡が可能になりました。失敗時に適応したり、次のステップへの移行タイミングを判断できます。また、複数のロボットが共有空間で協力し、単体では不可能な複雑なワークフローを完了させる機能も追加されています。
安全性とベンチマーク性能の向上
安全基準において大きな進歩があり、人間の接近を検知してロボットの動作を一時停止するなどの挙動を確認しています。評価指標では、成功・失敗の検出や計器類の読み取り精度が向上し、他のモデルを上回る結果を示しています。
