日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.07596v1

LIRA: 視覚言語行動デコーディングのための局所クロスレイヤー情報ルーティング

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルにおいて、VLMの中間特徴をアクションデコーダに効率的にルーティングする新しい機構LIRAを提案し、ベースラインを上回る性能を達成した。

詳しい要約

1. どんなもの?

LIRAは、Vision-Language-Action (VLA)モデルにおいて、事前学習済みのVision-Language Model (VLM)の中間特徴をアクションデコーダにルーティングするインターフェースを改良する手法。既存の設計は表現階層の一部しか露出しないか、デコーダブロックを単一のVLM層に固定的にマッチさせるため、深さ方向の補完的なタスク情報へのアクセスが制限される。LIRAは、深さを考慮した情報ルーティングとしてVLM-to-action conditioningを定式化し、タスクトークン特徴とLIRA Query特徴を中間VLM状態から導出し、各Parallel Fusion Blockに深さ整合のローカルウィンドウを割り当てる。これにより、バックボーンアーキテクチャ、アクションデコーダ、教師あり学習レシピは変更しない。

2. 先行研究と比べてどこがすごい?

先行研究のVLA-Adapterベースラインと比較して、LIRAは中間VLM特徴のルーティングをより柔軟にし、複数層からの補完的な情報を局所的に集約できる点が優れている。既存手法は単一層への固定マッチングや狭い範囲の特徴露出に限定されるが、LIRAは深さ整合のローカルウィンドウを用いて隣接するLIRA Query特徴を集約し、タスクトークン特徴とプロプリオセプティブ入力を統合する。これにより、同じ0.5Bパラメータ構成で主要な集約メトリクスを改善し、特にゼロショット転移で成功率を59.1%から78.0%に向上させるなど、ロバスト性が向上する。

3. 技術・手法の肝は?

LIRAの核心は、VLMの中間状態からタスクトークン特徴とLIRA Query特徴を導出し、各Parallel Fusion Blockに深さ整合のローカルウィンドウを割り当てること。Parallel Fusion Blockは、対応するVLM層を中心とした隣接LIRA Query特徴を集約し、タスクトークン特徴とプロプリオセプティブ入力を統合してからアクション予測を行う。このルーティングインターフェースは、バックボーン、アクションデコーダ、教師あり学習レシピを変更せずに、深さ方向の情報ルーティングを実現する。

4. どうやって有効だと検証した?

LIBERO、LIBERO-Plus、CALVIN ABC→D、および実世界のマニピュレーションタスクで検証。同じ0.5Bパラメータ構成のVLA-Adapterベースラインと比較して、主要な集約メトリクスを改善。特に、LIBERO-Plusへのゼロショット転移では、平均成功率が59.1%から78.0%に向上し、18.9ポイントの改善が見られた。これは、制御された分布シフト下でのロバスト性向上を示す。

5. 議論はある?

要旨からは、LIRAの限界や潜在的な欠点についての議論は不明。ただし、ゼロショット転移での改善は顕著であるが、他のタスクでの詳細な性能差や、計算コスト、スケーラビリティなどについては言及がない。また、LIRAが特定のVLAモデルやタスクに依存する可能性も考えられるが、要旨からは断定できない。

6. 次に読むべき論文は?

要旨で参照されているVLA-Adapterベースライン、および関連するVLAモデルやVLM-to-action conditioningの研究。具体的には、VLA-Adapterの論文や、Vision-Language-Actionモデルの基盤となる研究(例:RT-2、PaLM-Eなど)が考えられる。また、クロスレイヤー情報ルーティングやマルチスケール特徴融合に関する研究も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

分類: cs.RO, cs.CV

原文アブストラクト

Vision-Language-Action (VLA) models transform representations from pretrained vision-language models (VLMs) into robot actions, yet the interface that routes intermediate VLM features into action decoders remains underexplored. Existing designs either expose only a narrow part of the representation hierarchy or rigidly match each decoder block to one VLM layer, restricting access to complementary task evidence across depths. We introduce LIRA, a local cross-layer action-conditioning mechanism that formulates VLM-to-action conditioning as depth-aware information routing. LIRA operates on task-token features and LIRA Query features derived from intermediate VLM states, then assigns each Parallel Fusion Block a depth-aligned local window centered on its corresponding VLM layer. Parallel Fusion Blocks aggregate neighboring LIRA Query features and integrate them with task-token features and proprioceptive inputs before action prediction. This routing interface leaves the backbone architecture, action decoder, and supervised training recipe unchanged. Across LIBERO, LIBERO-Plus, CALVIN ABC$\rightarrow$D, and real-world manipulation, LIRA improves the principal aggregate metrics over the VLA-Adapter baseline under the same 0.5B-parameter configuration. In zero-shot transfer to LIBERO-Plus, LIRA increases average success from 59.1% to 78.0%, an 18.9-point gain indicating improved robustness under controlled distribution shifts.