日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
操作/ベンチマークarXiv:2609.05178

LIBERO-RECOVER: タスク成功を超えて—ロボット操作モデルにおける失敗回復へ

LIBERO-RECOVER: Beyond Task Success Towards Failure Recovery in Robotic Manipulation Models

シェア:XThreadsFacebookLINEはてブBluesky

既存のロボット操作ベンチマークは理想条件での成功率のみを測るが、実世界では失敗がつきものである。本論文は、最先端モデルの実実行失敗を収集し、4段階の回復レベルを含む大規模ベンチマークLIBERO-Recoverを導入して、失敗回復能力を評価する。

詳しい要約

1. どんなもの?

LIBERO-Recoverは、ロボット操作における失敗回復(failure recovery)能力を評価するための大規模ベンチマークである。既存のベンチマークが理想的な初期状態からのタスク成功率のみを測定するのに対し、本ベンチマークは実世界で発生しうる失敗(把持失敗、衝突、意図しない物体移動など)からの回復能力に焦点を当てる。LIBEROを基盤とし、SOTAのembodiedモデルから実際の実行失敗を収集して1,000以上のシナリオを構築し、4つの回復レベル(Action Retry, Action Adaptation, Object State Recovery, Environmental Recovery)と4つのコア能力(空間理解、物体構造推論、相互作用理解、トポロジー推論)を評価する。

2. 先行研究と比べてどこがすごい?

既存のベンチマーク(LIBEROなど)はタスク成功率がほぼ100%に達し、実世界展開可能かのように見えるが、理想条件での成功は実世界の堅牢性を保証しない。先行研究は主にタスク完了のみを評価し、失敗からの回復能力を測定していない。LIBERO-Recoverは、失敗回復に特化した初の大規模ベンチマークであり、評価の焦点を「ロボットは成功できるか」から「失敗後に回復できるか」へとシフトさせる点が革新的である。

3. 技術・手法の肝は?

手法の肝は、SOTAのembodiedモデル(VLAやWAM)をLIBERO環境で実行し、実際に発生した失敗を収集してシナリオを構築する点にある。回復レベルを4段階に分類し、各レベルで必要な能力(空間理解、物体構造推論、相互作用理解、トポロジー推論)を評価する設計となっている。これにより、単なるタスク成功率ではなく、失敗からの回復に必要な認知・行動能力を体系的に測定する。

4. どうやって有効だと検証した?

要旨からは、具体的な検証方法(どのモデルを評価したか、比較ベースラインなど)は不明である。ただし、SOTAのembodiedモデルから収集した実失敗に基づく1,000以上のシナリオを用いて、4つのコア能力を評価することでベンチマークの有効性を示すとしている。

5. 議論はある?

要旨からは、議論や限界についての具体的な記述は不明である。ただし、ベンチマークが理想条件と実世界のギャップを埋めることを目的としており、失敗回復能力の重要性を強調している。また、評価指標を成功率から回復能力へシフトさせることの意義が議論の対象となりうる。

6. 次に読むべき論文は?

要旨で参照されている先行研究として、LIBEROベンチマーク、Vision-Language-Action (VLA)モデル、World Action Model (WAM)が挙げられる。また、関連する失敗回復の研究や、ロボット操作の堅牢性評価に関する論文を読むことが推奨される。具体的な論文タイトルは要旨にないため、同分野の定番である「LIBERO」や「VLAモデル」の原著論文が次に読むべき候補となる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Lin Liu, Zhicheng Bao, Lu Zhang, Ziying Song, Wu Yang, Shuai Tao, Wulong Liu, Huchuan Lu

分類: cs.RO

原文アブストラクト

Vision-Language-Action (VLA) or World Action (WAM) models have recently demonstrated remarkable performance in robotic manipulation. On LIBERO, SOTA method have achieved nearly 100\% success rates, seemingly suggesting that the models are ready for deployment in real world. However, near perfect performance on existing benchmarks can be misleading: success under ideal conditions does not imply real world robustness. Existing benchmarks primarily evaluate task completion from predefined initial states, while real world interactions inevitably involve failures such as failed grasps, collisions, and unintended object movements. A robot must therefore not only execute tasks successfully, but also recognize and recover from failures to continue the task. Yet this capability remains largely unmeasured, revealing a critical gap between benchmark performance and real world reliability. To address this gap, we introduce LIBERO-Recover Benchmark, a large scale benchmark for failure recovery in robotic manipulation. Built upon LIBERO, we collect real execution failures from SOTA embodied models and construct 1,000+ scenarios across four recovery levels: (1) Action Retry, (2) Action Adaptation, (3) Object State Recovery, and (4) Environmental Recovery. We evaluate four core capabilities: spatial understanding, object structure reasoning, interaction understanding, and topological reasoning. As the first large-scale benchmark for embodied failure recovery, LIBERO-Recover shifts evaluation from \emph{Can the robot succeed?''} to \emph{Can the robot recover after failure?''}, promoting robust and generalizable embodied agents. The project will be avaible in \textcolor{blue}{https://liulin815.github.io/LIBERO-Recovery/}.

関連論文