何が起きたか
2024年10月15日にarXivで公開された論文「Latent Action Pretraining from Videos」において、ロボットの動作ラベルを必要としない事前学習手法「LAPA(Latent Action Pretraining for general Action models)」が提案された。この手法は、インターネット上の大規模動画から潜在的な動作を学習し、視覚言語行動(VLA)モデルを事前学習する。実験では、言語条件付けや未知物体への一般化などで、既存の大規模動画学習手法や動作ラベルを用いた最先端VLAモデルを上回る性能を示したと報告されている。
詳細
LAPAは、教師なしでVLAモデルを事前学習する手法である。まず、VQ-VAEベースの目的関数を用いて、画像フレーム間の離散的な潜在動作を学習するアクション量子化モデルを訓練する。次に、観測とタスク記述からこれらの潜在動作を予測する潜在VLAモデルを事前学習する。最後に、小規模なロボット操作データで微調整し、潜在動作をロボットの実際の動作にマッピングする。実験では、人間の操作動画のみで訓練した場合でも正の転移が確認され、ウェブスケールのデータをロボティクス基盤モデルに活用できる可能性が示された。
Key Facts
| LAPAは、ロボットの動作ラベルなしでVLAモデルを事前学習する教師なし手法である。 | 出典一覧 |
| LAPAは、VQ-VAEベースの目的関数を用いて離散的な潜在動作を学習する。 | 出典一覧 |
| 実験では、LAPAは既存の大規模動画学習手法や動作ラベルを用いた最先端VLAモデルを上回る性能を示したと報告されている。 | 出典一覧 |
| 人間の操作動画のみで訓練した場合でも正の転移が確認された。 | 出典一覧 |
本紙の見方
本手法の新規性は、ロボット動作ラベルを必要とせずにインターネット規模の動画からVLAモデルを事前学習できる点にある。従来のVLAモデルは、人間のテレオペレーションによる動作ラベルを必要とし、データソースとスケールに制約があった。LAPAは、VQ-VAEを用いて潜在動作を量子化し、タスク記述と観測から潜在動作を予測することで、ラベルなし動画を学習に活用する。このアプローチは、ロボット基盤モデルの学習データの壁を低減する可能性がある。 実験結果では、言語条件付けや未知物体・未知命令への一般化において、動作ラベルを用いた最先端VLAモデルを上回る性能を示したとされる。これは、ラベルなしデータの活用が性能向上に寄与する可能性を示唆する。ただし、論文の主張であり、第三者による検証はまだない。 業界への含意として、ロボット学習におけるデータ収集コストの削減が期待される。テレオペレーションによるデータ収集は高コストであり、ウェブ上の動画を活用できれば、学習データの規模を拡大できる。また、人間の動画からの転移が確認されたことは、シミュレーションや実機データに依存しない学習の可能性を開く。 未確定の論点としては、実ロボットでの性能評価の詳細、量子化モデルの精度、大規模データでのスケーラビリティ、安全性などが挙げられる。特に、実世界の多様な環境での汎化性能や、潜在動作の解釈可能性が今後の焦点になる。
なぜ重要か
ロボット学習におけるデータ不足は長年の課題であり、LAPAはラベルなし動画を活用することでその解決に一歩近づく。この手法が確立されれば、ロボット基盤モデルの開発コストが大幅に下がり、より多様なタスクへの適応が進む可能性がある。