何が起きたか

既存のチャンクベースのVision-Language-Action(VLA)モデルは、再計画までの実行アクション数(実行間隔)が固定されており、タスクの進行状況に関係なく周期的に再計画が行われる。このため、重要な操作段階の前に再計画の境界がない場合、古いチャンクに基づいて実行される問題があった。この問題に対処するため、Bernoulli-Continuation Policy(BCP)が提案された。BCPは、ベースとなるVLAを凍結したまま、軽量でプラグアンドプレイな適応的実行間隔のフレームワークである。固定長のアクションチャンクが与えられると、その継続ヘッドが実行間隔の選択を「継続か再計画か」の一連の判断に分解し、候補となる間隔を独立したクラスとして扱うのではなく、順序的で接頭辞を共有する帰納的バイアスを課す。各チャンクの最適な間隔は観測できないため、このヘッドは軌跡レベルの結果からの強化学習で訓練され、タスク成功とVLA使用効率を同時に報酬とする「Replanning-Efficiency Reward」を導入し、ポリシーが不必要に短い間隔に崩壊するのを防ぐ。RoboTwin 2.0でLingBot-VLAをベースポリシーとして使用した場合、BCPは成功率の低い13タスクで平均成功率を+11.08%向上させ、全50タスクでは89.88%から93.94%(+4.06%)に向上した。Clean設定でのみ訓練されたが、Randomized設定にも一般化し、平均成功率を+4.06%向上させた。また、異なるベースポリシーπ0.5にも転移し、LIBEROで+1.7%、より難しいLIBERO-PROで+6.8%の改善を達成した。実ロボットでは、2つの操作タスクで成功率が74%から92%、44%から84%に向上した。さらに、オーバーヘッドが無視できるほど小さく、成功率が高いため、BCPの全体的な実行時間は固定間隔のベースラインよりも短い。

Key Facts

既存のチャンクベースのVLAモデルは、再計画前に固定数のアクションを実行するため、再計画がタスクの進行状況と無関係な周期的スケジュールになっている。[0]
BCPは、ベースVLAを凍結したまま、軽量でプラグアンドプレイな適応的実行間隔のフレームワークである。[0]
BCPの継続ヘッドは、実行間隔の選択を「継続か再計画か」の一連の判断に分解し、順序的で接頭辞を共有する帰納的バイアスを課す。[0]
BCPのヘッドは、軌跡レベルの結果からの強化学習で訓練され、Replanning-Efficiency Rewardがタスク成功とVLA使用効率を同時に報酬とする。[0]
RoboTwin 2.0でLingBot-VLAをベースポリシーとして使用した場合、BCPは成功率の低い13タスクで平均成功率を+11.08%向上させた。[0]
全50タスクでは、成功率が89.88%から93.94%(+4.06%)に向上した。[0]
Clean設定でのみ訓練されたが、Randomized設定にも一般化し、平均成功率を+4.06%向上させた。[0]
異なるベースポリシーπ0.5に転移し、LIBEROで+1.7%、LIBERO-PROで+6.8%の改善を達成した。[0]
実ロボットでは、2つの操作タスクで成功率が74%から92%、44%から84%に向上した。[0]
BCPのオーバーヘッドは無視できるほど小さく、成功率が高いため、全体的な実行時間は固定間隔のベースラインよりも短い。[0]

なぜ重要か

この研究は、VLAモデルの実行間隔をタスクの進行に応じて適応的に決定する新しい手法を提案しており、固定間隔による非効率性を改善する可能性がある。シミュレーションと実ロボットの両方で成功率の向上が確認されており、ロボット操作の性能向上に寄与する可能性がある。