何が起きたか
2025年10月20日にarXivに公開された論文(ID: 2510.17640v4)で、RESampleと呼ばれるデータ拡張フレームワークが提案された。RESampleは、Vision-Language-Action(VLA)モデルのロボット操作における失敗回復を目的とし、カバレッジ関数を用いて失敗事例を特定し、探索的サンプリングにより失敗回復軌道を追加する。実験では、LIBEROベンチマークと実世界の操作タスクにおいて、成功率を最大12%絶対的に向上させ、追加サンプルは20%以下に抑えられた。
詳細
VLAモデルは大規模な模倣学習データセットで訓練されると強い操作能力を示すが、これらのデータセットは主に成功軌道で構成されており、実行が標準的なデモンストレーションから逸脱した場合に必要な修正監督をほとんど提供しない。展開中、これらの物理的逸脱は分布シフトを引き起こし、ポリシーを失敗シナリオに導くが、失敗回復データの欠如によりポリシーはこれらの実行逸脱を修正できない。 この問題に対処するため、RESampleはカバレッジ誘導型データ拡張フレームワークを提案する。具体的には、実際のデータ分布内に存在するが標準的な成功デモンストレーションには欠けている失敗事例を特定するために、保守的なカバレッジ関数を訓練する。評価されたカバレッジの不一致に基づき、探索行動とそれに続く回復行動を積極的にサンプリングし、失敗回復軌道で訓練データのカバレッジを拡張する。拡張された軌道により、実環境で逸脱したポリシーは失敗から回復できる。
Key Facts
| RESampleは、ロボット操作の失敗回復を目的としたデータ拡張フレームワークである。 | [1] |
| RESampleは、カバレッジ関数を用いて失敗事例を特定し、探索的サンプリングにより失敗回復軌道を追加する。 | [1] |
| 実験はLIBEROベンチマークと実世界の操作タスクで行われた。 | [1] |
| RESampleは成功率を最大12%絶対的に向上させた。 | [1] |
| 追加サンプルは20%以下に抑えられた。 | [1] |
| 論文はarXivに2025年10月20日に公開された(ID: 2510.17640v4)。 | [1] |
なぜ重要か
この研究は、ロボット操作における失敗回復の課題に取り組むものであり、VLAモデルの実世界展開での堅牢性向上に寄与する可能性がある。データ拡張による成功率向上は、模倣学習の限界を補う実用的な手法として注目される。