何が起きたか
研究チームは2026年7月15日、arXivプレプリントでLIFT(Late Reactive Injection of Force for VLA Post-Training)を発表した。LIFTは、事前学習済みVLAポリシーに接触反応性を追加する力覚対応後訓練フレームワークで、反応型アクションエキスパートを既存のアクションエキスパートの隣に移植し、事前学習済みの重みから初期化する。実験では、タオル折り、本挿入、ハノイの輪配置の3タスクで、視覚のみの後訓練より速く学習し、高い性能に到達した。
詳細
LIFTは、事前学習済みVLAポリシーの一般操作知識を保持しつつ、接触状態での反応性を追加する。具体的には、反応型アクションエキスパートを既存のアクションエキスパートの隣に移植し、事前学習済みのアクション重みから初期化する。最近の6次元エンドエフェクタ力を因果的力覚メモリとゼロ初期化クロスアテンションを通じて注入し、実行中にアクションを更新できるようにする。さらに、接触フィードバックのポリシー依存の分布シフトに対処するため、オフラインのタスク整合データと人間が修正したオンラインロールアウトの混合で訓練するオンラインDAggerループを組み合わせる。アブレーションでは、反応型力覚メモリとオンライン修正データの両方が、堅牢な接触リッチ操作に重要であることが示された。コードとデータは公開予定。
Key Facts
| LIFTは、事前学習済みVLAポリシーに接触反応性を追加する力覚対応後訓練フレームワークである。 | 出典一覧 |
| LIFTは、反応型アクションエキスパートを既存のアクションエキスパートの隣に移植し、事前学習済みのアクション重みから初期化する。 | 出典一覧 |
| LIFTは、最近の6次元エンドエフェクタ力を因果的力覚メモリとゼロ初期化クロスアテンションで注入する。 | 出典一覧 |
| LIFTは、オフラインのタスク整合データと人間が修正したオンラインロールアウトの混合で訓練するオンラインDAggerループを組み合わせる。 | 出典一覧 |
| タオル折り、本挿入、ハノイの輪配置の3タスクで、LIFTは視覚のみの後訓練より速く学習し、高い性能に到達した。 | 出典一覧 |
本紙の見方
今回の発表は、VLAポリシーの後訓練に力覚情報を組み込む新たな枠組みを示した点で新規性がある。事前学習済みVLAは視覚中心で、接触状態ではシーンが遮蔽されたり、深度が曖昧になったり、小さな力の誤差がオフラインのデモ分布から逸脱する問題があった。LIFTは、反応型アクションエキスパートを追加し、力覚を注入することで、この問題に対処する。これは、既存のVLAの知識を保持しながら接触反応性を高めるアプローチであり、後訓練の効率と性能を向上させる。 本紙の過去報道との接続はないが、ロボット学習分野では、模倣学習や強化学習に力覚を組み込む研究が進んでいる。LIFTは、VLAの後訓練に特化した点で、実用化に向けた一歩とみられる。 業界構造への含意としては、接触を伴う操作タスク(組立、布地操作など)の自動化に寄与する可能性がある。力覚センサの活用が進み、ロボットの器用さが向上すれば、製造業や物流などでの適用範囲が広がる。 未確定の論点としては、実ロボットでの性能、学習データの量と質、力覚センサのコスト、他のタスクへの汎化性などが挙げられる。特に、オンラインDAggerループの人間の介入コストが実用化の障壁になる可能性がある。
なぜ重要か
VLAポリシーは言語指示による操作に強みを持つが、接触状態での反応性が課題だった。LIFTは、力覚を後付けで注入することで、この課題を解決する可能性を示した。これにより、接触を伴う複雑な操作タスクの自動化が進み、ロボットの実用範囲が広がることが期待される。