何が起きたか

Skild AIは公式ブログで、人間の動画を見せることでロボットに新しいスキルを学習させる手法を発表した。同社は、大規模言語モデル(LLM)がインターネット上のテキストで学習するのに対し、ロボット分野ではデータ不足が課題と説明。従来の遠隔操作によるデータ収集は、多様性と規模の点で限界があると指摘した。その解決策として、人間の動画データを利用し、ロボットの形態の違い(エンボディメントギャップ)をモデルが橋渡しすることで、動画のみと1時間未満のロボットデータで新しいスキルを学習できるとしている。

Key Facts

Skild AIは、人間の動画を見せることでロボットに新しいスキルを学習させる手法を発表した。[0]
同社は、遠隔操作によるデータ収集は多様性と規模の点で2つの致命的な課題があると説明している。[0]
同社は、人間の動画データはすでに豊富に存在し、ロボット分野の「インターネット規模」のデータセットはすでに存在すると述べている。[0]
同社は、動画データには力やトルク、触覚フィードバックなどの信号が欠けており、人間とロボットの形態の違い(エンボディメントギャップ)が技術的課題だと説明している。[0]
同社は、モデルを微調整し、動画のみと1時間未満のロボットデータで新しいスキルを学習できるとしている。[0]

なぜ重要か

ロボット学習におけるデータ不足は業界共通の課題であり、Skild AIの手法は、遠隔操作に依存せずに人間の動画を活用することで、基盤モデル規模の学習を可能にする可能性がある。同社の主張が実証されれば、ロボットのタスク学習の効率が大幅に向上する可能性がある。