何が起きたか
arXivに公開された論文(ID: 2608.07596v1)において、VLAモデルのための新しいメカニズム「LIRA(Local Cross-Layer Information Routing)」が提案された。LIRAは、事前学習済みの視覚言語モデル(VLM)の中間特徴を行動デコーダにルーティングする方法を改良し、深さ方向の情報ルーティングとして定式化する。具体的には、タスクトークン特徴とLIRA Query特徴を用い、各Parallel Fusion BlockにVLM層に対応する局所ウィンドウを割り当て、近傍のLIRA Query特徴を集約してタスクトークン特徴やプロプリオセプティブ入力と統合する。この手法は、バックボーンアーキテクチャ、行動デコーダ、教師あり学習レシピを変更しない。評価では、LIBERO、LIBERO-Plus、CALVIN ABC→D、実世界操作において、同パラメータ構成(0.5B)のVLA-Adapterベースラインと比較して主要な指標を改善した。特に、LIBERO-Plusへのゼロショット転移では、平均成功率が59.1%から78.0%に向上し、18.9ポイントの改善が見られた。
Key Facts
| LIRAは、VLMから行動デコーダへの情報ルーティングを深さ認識型として定式化するメカニズムである。 | [0] |
| LIRAは、タスクトークン特徴とLIRA Query特徴を使用し、各Parallel Fusion BlockにVLM層に対応する局所ウィンドウを割り当てる。 | [0] |
| LIRAは、バックボーンアーキテクチャ、行動デコーダ、教師あり学習レシピを変更しない。 | [0] |
| LIBERO、LIBERO-Plus、CALVIN ABC→D、実世界操作において、LIRAはVLA-Adapterベースライン(0.5Bパラメータ)と比較して主要な指標を改善した。 | [0] |
| LIBERO-Plusへのゼロショット転移で、LIRAは平均成功率を59.1%から78.0%に向上させた(18.9ポイントの改善)。 | [0] |
なぜ重要か
VLAモデルはロボットの行動生成に広く使われているが、VLMの中間特徴を行動デコーダにどう渡すかというインターフェースの設計は未解明の部分が多かった。LIRAはこのインターフェースを改良することで、既存のアーキテクチャや学習手順を変えずに性能を向上させられることを示しており、ロボット操作の精度向上に寄与する可能性がある。特に、分布シフト下でのロバスト性向上が示唆されており、実世界応用への貢献が期待される。