日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.07756

StairVLA:視覚言語行動モデルのための段階認識型階層的行動生成

StairVLA: Stage-Aware Hierarchical Action Generation for Vision-Language-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

拡散・フローマッチング型の行動生成をノイズ除去の段階ごとに役割分担させ、高レベルVLAが粗い長期軌道を作り軽量リファイナが高頻度で局所修正することで、推論コストを削減しつつ成功率を向上させた。

詳しい要約

1. どんなもの?

- Vision-Language-Action (VLA) モデルにおける拡散・フローマッチングベースの行動ヘッドの新しい生成フレームワーク。 - ノイズ除去の段階に応じて条件付けの焦点が変化することを利用し、粗い長期行動生成と局所的な洗練を階層化。 - 高レベルVLAが初期のノイズ除去を行い、再利用可能な長期行動軌跡を生成。 - 軽量リファイナが高頻度で最新の観測を用いて局所行動チャンクを洗練。 - 計算コストを償却しつつ、頻繁な閉ループ補正を維持。

2. 先行研究と比べてどこがすごい?

- 従来のVLA行動ヘッドはノイズ除去過程をほぼ均一に処理していた。 - StairVLAは段階に応じた条件付けの変化を明示的に活用し、階層的な行動生成を実現。 - 高レベルVLAの計算を償却し、推論レイテンシを大幅に削減(115.0 msから44.2 ms)。 - 成功率も向上(LIBEROで96.5%から97.8%)。 - 複数のVLAバックボーン、シミュレーションベンチマーク、実機タスクで一貫した性能維持とコスト削減を達成。

3. 技術・手法の肝は?

- 部分的にノイズ除去された行動を、粗い長期行動生成と局所洗練の間の自然なインターフェースとして使用。 - 高レベルVLAが初期のノイズ除去を実行し、長期行動軌跡を生成。 - 軽量リファイナが高頻度で最新の観測を用いて局所行動チャンクを洗練。 - これにより高レベルVLAの計算を償却しつつ、頻繁な閉ループ補正を可能にする。 - GR00Tスタイルのインスタンス化を採用。

4. どうやって有効だと検証した?

- LIBEROベンチマークで評価。 - GR00Tスタイルのインスタンス化により、平均成功率が96.5%から97.8%に向上。 - 償却推論レイテンシが行動チャンクあたり115.0 msから44.2 msに削減。 - 2つのVLAバックボーン、シミュレーションベンチマーク、実機タスクで検証。 - 推論コストを一貫して削減しつつ、強いタスク性能を維持。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- GR00T - LIBERO - 拡散・フローマッチングベースのVLA行動ヘッドに関する研究

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shangyuan Yuan, Xinda Qi, Yujiang Pu, Wenliang Guo, Xiaobo Tan

分類: cs.RO

原文アブストラクト

Vision-language-action (VLA) models increasingly rely on diffusion- or flow-matching-based action heads to generate continuous robot actions. These action heads typically process the denoising trajectory in a largely uniform manner. However, we observe that the conditioning focus naturally shifts across denoising stages: early stages combine language instructions and visual observations to establish a coarse action trajectory, whereas later stages place greater emphasis on current visual observations for action alignment. Based on this insight, we introduce StairVLA, a stage-aware hierarchical action generation framework that uses partially denoised actions as a natural interface between coarse long-horizon action generation and local refinement. A high-level VLA performs early denoising to produce a reusable long-horizon partially denoised action trajectory, while a lightweight refiner operates at a higher frequency to refine local action chunks using the latest observations. This design amortizes expensive high-level VLA computation while preserving frequent closed-loop correction. On LIBERO, our GR00T-style instantiation improves average success from 96.5% to 97.8% while reducing amortized inference latency from 115.0 ms to 44.2 ms per action chunk. More broadly, across two VLA backbones, simulation benchmarks, and real-robot tasks, StairVLA consistently reduces inference cost while maintaining strong task performance.

関連論文

PR本紙発行元 EmplifAI