NVIDIAは2026年9月10日、Skild AIが開発した新しいロボット基盤モデル「S1」について発表しました。このモデルは、1本の動画を見せるだけで、事前に学習していない複雑な作業を即座に実行できる技術を実現しています。
動画から即座に動作を学習
従来の産業用ロボットは、作業内容や配置が変わるたびに、膨大なデータの収集と再学習が必要でした。これに対し、S1は「インコンテキスト学習」という手法を採用しています。オペレーターが目的の作業を動画で記録してモデルに与えるだけで、モデルは対象物や手順を理解し、再学習なしでロボットの動作へと変換します。
S1は、植木鉢への植え付けやパンケーキ作り、コーヒーのドリップといった、最大10分間に及ぶ未知のタスクをこなすことが可能です。テストでは、動画の記録からロボットによる自律的な実行まで、わずか11分で完了しました。また、新しい多段階タスクの成功率は、従来のAIシステムが9%であったのに対し、S1は約66%を記録し、7倍以上の向上を果たしています。
製造現場への実用化
この技術はすでに実用段階にあり、Foxconnの製造ラインでも導入が進められています。具体的には、NVIDIA Blackwellシステムの高精度な組み立て作業において、デュアルアームマニピュレーターを用いたバスバーの取り付けや、16本のネジ留めなどの工程に活用されています。ロボットは作業中の乱れにも適応し、計画と異なる状況でも動作を継続できます。
Skild AIは、最初の商用導入から10か月間で年間売上高が1億ドルに達したとしています。同社は製造、物流、セキュリティなど、60件以上の導入パートナーシップを構築しており、実験室から実際の工場への展開を加速させています。
