何が起きたか

研究者らは2026年6月8日、arXivにてReCoVLAを発表した。ReCoVLAは、障害条件付き残差回復フレームワークであり、事前学習済みのVLAポリシーを凍結し、外部のVLMが障害モードと回復段階を推論して報酬を構成する。実験では、短時間・長時間・接触を伴う操作タスクにおいて、ベースライン平均を上回り、シミュレーションで成功率を36.7%から66.7%に向上させた。

詳細

ReCoVLAは、VLMを直接アクション生成や報酬生成に使うのではなく、意味的報酬セレクタとして用いる。VLMは回復記述子と報酬マスクを予測し、シミュレーション内の残差ポリシー訓練に使用される。訓練後はゼロショットで実機展開される。この設計により、高レベルの障害理解と低レベルの修正制御を分離し、異なるVLAをサポートする。実験では、微調整されたπ0.5ベースラインと比較して、シミュレーションで平均成功率を36.7%から66.7%に向上させた。実機ゼロショット展開では平均61.7%の成功率を達成した。

Key Facts

ReCoVLAは、事前学習済みのVLAポリシーを凍結し、外部VLMを用いて障害モードと回復段階を推論する障害条件付き残差回復フレームワークである。[1]
VLMはアクションや報酬を直接生成するのではなく、回復記述子と報酬マスクを予測する意味的報酬セレクタとして機能する。[1]
シミュレーション実験では、微調整されたπ0.5ベースラインの平均成功率36.7%を、ReCoVLAは66.7%に向上させた。[1]
実機ゼロショットsim-to-real展開では、ReCoVLAは平均成功率61.7%を達成した。[1]
実験は短時間、長時間、接触を伴う操作タスクで行われ、ReCoVLAはテストしたベースラインの平均を上回った。[1]

なぜ重要か

ReCoVLAは、VLAポリシーの障害回復を自動化する手法として、ロボットの実用化における信頼性向上に寄与する可能性がある。特に、シミュレーションと実機のギャップを埋めるゼロショット展開の成功は、今後のロボット学習研究の方向性を示唆する。