日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/ベンチマークarXiv:2608.30536v1

Behavior-Skill: 長期的タスクにおける視覚-言語-行動ポリシー評価のための細粒度ベンチマーク

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

シェア:XThreadsFacebookLINEはてブBluesky

長期的なモバイル操作タスクを構成するスキル単位で学習・評価するベンチマークを提案し、VLAポリシーの失敗箇所を詳細に分析できるようにした。

詳しい要約

1. どんなもの?

Behavior-Skillは、長期的なモバイル操作タスクにおけるVision-Language-Action (VLA)ポリシーの評価を、タスク全体ではなく実行可能な構成スキル単位に再構成したベンチマークである。50の家庭タスク、10,000のデモンストレーションから235,492のスキルインスタンスを提供し、34のセマンティックスキルカテゴリをカバーする。各インスタンスはスキル命令と観測・行動セグメントのペア、復元可能な中間状態、スキル成功条件を備え、有効な前提条件の下で独立評価を可能にする。

2. 先行研究と比べてどこがすごい?

既存のベンチマークは主にフルタスクのロールアウトとタスクレベルの集約メトリクスに依存しており、中間の失敗を観察・分析することが困難である。Behavior-Skillは、スキルレベルの評価を導入し、タスク成功の前提となる個々のスキルの成功を独立に評価できる点で優れている。これにより、失敗の原因となる特定のスキルを特定し、VLAポリシーの能力プロファイルを詳細に明らかにできる。

3. 技術・手法の肝は?

手法の肝は、長期的タスクを構成スキルに分解し、各スキルを独立に評価できるようにした点である。具体的には、デモンストレーションからスキル命令と観測・行動セグメントを抽出し、各スキルに復元可能な中間状態と成功条件を関連付ける。さらに、軌道レベルとスキルレベルのメトリクスを導入し、タスク成功の集約だけでなく、スキルごとの成功・失敗を評価する。

4. どうやって有効だと検証した?

代表的なVLAポリシー(pi0.5、GR00T)を50タスクの完全なベンチマークで評価した。その結果、失敗はスキル間で非常に不均一であり、接触を伴う操作スキルが持続的なボトルネックとなることを示した。これにより、Behavior-Skillがフルタスク評価を補完し、中間能力プロファイルを明らかにすることで、長期的VLAポリシーの分析と改善に有効であることを実証した。

5. 議論はある?

要旨からは、スキル間の依存関係やスキルシーケンスの最適化に関する議論は不明である。また、ベンチマークのスキル分割の粒度や、スキル成功条件の設計が評価結果に与える影響についての考察は要旨に含まれていない。さらに、提案されたメトリクスがタスク成功とどの程度相関するかについての詳細な分析も要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されているVLAポリシーであるpi0.5とGR00Tの論文が次に読むべきである。また、関連するベンチマークとして、Behavior-1Kや、長期的タスクの評価に関する既存研究(例:ALOHA、RT-2など)も挙げられるが、要旨で明示されていないため、一般名で示す。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

分類: cs.RO

原文アブストラクト

Reliable execution of long-horizon mobile manipulation tasks remains challenging because overall task success depends on the successful completion of multiple constituent skills. Existing benchmarks, however, still rely primarily on full-task rollouts and aggregate task-level metrics, making intermediate failures difficult to observe and analyze. We present Behavior-Skill, a benchmark that reformulates the learning and evaluation of long-horizon tasks around executable constituent skills. It contains 235,492 skill instances from 10,000 demonstrations across 50 household tasks and 34 semantic skill categories. Each instance pairs a skill instruction with an aligned observation-action segment, and is further associated with a restorable intermediate state and a skill success condition to enable independent evaluation under valid preconditions. We further introduce trajectory-level and skill-level metrics to characterize policy capability beyond aggregate task success. Extensive experiments across representative VLA policies including pi0.5 and GR00T on the complete 50-task benchmark show that failures are highly non-uniform across skills, with contact-rich manipulation skills forming persistent bottlenecks. These results demonstrate that Behavior-Skill complements full-task evaluation by exposing intermediate capability profiles for analyzing and improving long-horizon VLA policies. Behavior-Skill is publicly available at https://github.com/nubot-nudt/Behavior-Skill.

関連論文