何が起きたか

研究チームは2026年7月15日、arXivプレプリントでLIFT(Late Reactive Injection of Force for VLA Post-Training)を発表した。LIFTは、事前学習済みVLAポリシーに接触反応性を追加する力覚対応後訓練フレームワークで、反応型アクションエキスパートを既存のアクションエキスパートの隣に移植し、事前学習済みの重みから初期化する。実験では、タオル折り、本挿入、ハノイの輪配置の3タスクで、視覚のみの後訓練より速く学習し、高い性能に到達した。

詳細

LIFTは、事前学習済みVLAポリシーの一般操作知識を保持しつつ、接触状態での反応性を追加する。具体的には、反応型アクションエキスパートを既存のアクションエキスパートの隣に移植し、事前学習済みのアクション重みから初期化する。最近の6次元エンドエフェクタ力を因果的力覚メモリとゼロ初期化クロスアテンションを通じて注入し、実行中にアクションを更新できるようにする。さらに、接触フィードバックのポリシー依存の分布シフトに対処するため、オフラインのタスク整合データと人間が修正したオンラインロールアウトの混合で訓練するオンラインDAggerループを組み合わせる。アブレーションでは、反応型力覚メモリとオンライン修正データの両方が、堅牢な接触リッチ操作に重要であることが示された。コードとデータは公開予定。

Key Facts

LIFTは、事前学習済みVLAポリシーに接触反応性を追加する力覚対応後訓練フレームワークである。[1]
LIFTは、反応型アクションエキスパートを既存のアクションエキスパートの隣に移植し、事前学習済みのアクション重みから初期化する。[1]
LIFTは、最近の6次元エンドエフェクタ力を因果的力覚メモリとゼロ初期化クロスアテンションで注入する。[1]
LIFTは、オフラインのタスク整合データと人間が修正したオンラインロールアウトの混合で訓練するオンラインDAggerループを組み合わせる。[1]
タオル折り、本挿入、ハノイの輪配置の3タスクで、LIFTは視覚のみの後訓練より速く学習し、高い性能に到達した。[1]

なぜ重要か

VLAポリシーは言語指示による操作に強みを持つが、接触状態での反応性が課題だった。LIFTは、力覚を後付けで注入することで、この課題を解決する可能性を示した。これにより、接触を伴う複雑な操作タスクの自動化が進み、ロボットの実用範囲が広がることが期待される。