日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/ベンチマークarXiv:2609.05324

RoboSPA: VLAモデルは単純なシーンと短期的なタスクを超えられるか?

RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの空間的・手続き的複雑さに対する推論能力を診断する大規模ロボット操作ベンチマークRoboSPAを提案し、既存モデルの限界を明らかにした。

詳しい要約

1. どんなもの?

RoboSPAは、VLA (Vision-Language-Action) モデルの空間的・手続き的複雑さに対する推論能力を診断するための大規模ロボット操作データセットおよびベンチマークである。10のタスクカテゴリ、56の基本タスクをカバーし、各タスクは5段階の難易度でインスタンス化され、合計280のバリアントを持つ。527Kの軌跡が複数のembodimentと多様なシーンで収集されている。

2. 先行研究と比べてどこがすごい?

既存のデータセットやベンチマークは、事前定義された設定下でのタスク完了率のみを評価し、空間的・手続き的複雑さが増す中でのモデルの推論能力について限定的な洞察しか提供しない。RoboSPAは、Fine-Grained Spatial ReasoningとLong-Horizon Procedural Planningの2つの核心的な次元に焦点を当て、難易度を段階的に増加させることで、より詳細な診断を可能にする点が新しい。

3. 技術・手法の肝は?

RoboSPAは、空間的曖昧性と手続き的複雑性を増加させるように設計されたタスクを提供する。各タスクは5つの難易度レベルでインスタンス化され、280のバリアントを生成する。データは複数のembodimentと多様なシーンで収集され、527Kの軌跡が含まれる。評価には、二値の成功率に加えて、診断的メトリクスが導入されている。

4. どうやって有効だと検証した?

代表的なVLAモデルを用いた実験により、現在のシステムは複雑な空間関係、正確な低レベル実行、メモリ集約的な計画に依然として苦労していることを示した。これにより、RoboSPAが挑戦的な診断ベンチマークとして機能することが実証された。

5. 議論はある?

要旨からは、RoboSPAが診断ベンチマークとしての有効性を示す一方で、現在のVLAモデルの限界を浮き彫りにしている。しかし、具体的な議論や将来の方向性については要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されているVLAモデルに関する研究や、関連するロボット操作のデータセット・ベンチマーク(例:Language-Table、BridgeDataなど)が挙げられる。具体的な論文名は要旨に明記されていないため、同分野の定番であるVLAモデルの論文(例:RT-2、PaLM-E)や、ロボット操作ベンチマークの論文を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin, Liang Liang, Zhuoyi Huang, Wenqiao Zhang, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang

分類: cs.RO, cs.AI, cs.CV

原文アブストラクト

Vision-Language-Action (VLA) models have shown promising progress in language-conditioned robotic manipulation. However, existing datasets and benchmarks mainly evaluate task completion under predefined settings, offering limited insight into model reasoning under increasing spatial and procedural complexity. We introduce \textbf{RoboSPA} (\textbf{Robo}t \textbf{S}patial-\textbf{P}rocedural \textbf{A}ssessment), a large-scale robotic manipulation dataset and benchmark for diagnosing embodied reasoning in VLA models. \texttt{RoboSPA} focuses on two core dimensions, Fine-Grained Spatial Reasoning and Long-Horizon Procedural Planning, covering 10 task categories and 56 base tasks. Each task is instantiated across five difficulty levels, yielding 280 variants with increasing spatial ambiguity and procedural complexity. We collect 527K trajectories across multiple embodiments and diverse scenes. Beyond binary success rate, \texttt{RoboSPA} introduces diagnostic metrics for more detailed evaluation. Experiments on representative VLA models show that current systems still struggle with complex spatial relations, precise low-level execution, and memory-intensive planning. These results establish \texttt{RoboSPA} as a challenging diagnostic benchmark for developing more capable, reliable, and generalizable embodied agents. Our data and code are available at https://github.com/fanzhenxuan/RoboSPA.

関連論文