何が起きたか
研究チームは、ロボット操作のための軽量な世界行動モデル「LiLa-WAM」を提案した。従来の世界行動モデルは計算コストが高く、ピクセル空間方式は制御に無関係な視覚詳細に容量を割く一方、潜在空間方式は多段階の訓練を要するという課題があった。LiLa-WAMは、将来状態予測と行動生成によって共同で形成されるコンパクトな潜在推論空間を中核とし、軽量でありながら制御との整合性を保つ。タスク指定には、視覚特徴空間の方向として各タスクを符号化する言語不要の表現「Visual Transition Token (VTT)」を導入した。実験では、RoboTwin 2.0、LIBERO、実ロボットタスクで有効性を示し、単一GPU訓練でRoboTwinの50タスクにおいて90.48%の成功率を達成した。
Key Facts
| LiLa-WAMは、コンパクトな潜在空間で未来を推論する軽量な世界行動モデルであり、単一の24GB GPUでエンドツーエンドに訓練できる。 | [0] |
| 中核設計は、将来状態予測と行動生成によって共同で形成されるコンパクトな潜在推論空間であり、軽量性と制御への整合性を両立する。 | [0] |
| タスク指定のため、視覚特徴空間の方向として各タスクを符号化する言語不要の表現「Visual Transition Token (VTT)」を提案した。 | [0] |
| RoboTwin 2.0、LIBERO、実ロボットタスクでの実験により、単一GPU訓練でRoboTwinの50タスクにおいて90.48%の成功率を達成した。 | [0] |
なぜ重要か
ロボット操作における世界行動モデルは、観測への反応を超えてシーンの発展を予測する能力を提供するが、従来は計算コストや訓練の複雑さが課題だった。LiLa-WAMは、単一GPUで訓練可能な軽量設計と高い成功率を両立させており、限られた計算資源でも高度なロボット操作を実現できる可能性を示す。また、言語に依存しないタスク表現VTTは、多様なタスク指定の柔軟性を高める。