何が起きたか
研究チームは2026年6月10日、arXivにて「μVLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models」を発表した。μVLAは、事前学習済みVLAモデルに学習可能なメモリトークンを追加し、時間ステップをまたいで自己注意で更新する再帰メモリを導入した。MIKASA-Roboの5つの訓練タスクで平均成功率を0.42から0.84に向上させた。
詳細
μVLAは、OpenVLA-OFTをベースに、メモリ幅m、TBPTT長K、メモリ更新規則(クロスステップ勾配または分離EMA)をパラメータとする。補助損失やアーキテクチャ変更を加えず、再帰のみを変化させた制御比較を実施した。MIKASA-Roboでは、保持タスクで成功率0.23(メモリなしの0.07に対し)、異なるメモリ構造を要するタスクではベースラインと同等だった。LIBEROでは最強の再帰変種が平均成功率96.2%を達成し、完全観測下での性能低下がないことを示した。
Key Facts
| μVLAは、事前学習済みVLAモデルに学習可能なメモリトークンを追加し、時間ステップをまたいで自己注意で更新する再帰メモリを導入した。 | 出典一覧 |
| MIKASA-Roboの5つの訓練タスクで平均成功率が0.42から0.84に向上した。 | 出典一覧 |
| 保持タスクでは成功率0.23(メモリなしの0.07に対し)を達成した。 | 出典一覧 |
| LIBEROでは最強の再帰変種が平均成功率96.2%を達成した。 | 出典一覧 |
| μVLAは補助損失やアーキテクチャ変更を加えず、再帰のみを変化させた制御比較を実施した。 | 出典一覧 |
本紙の見方
今回の発表の新規性は、再帰メモリの効果を単独で検証するための制御比較にある。既存のメモリ拡張VLAは再帰に加えて検索や圧縮、補助目的などの複数の要素を同時に導入しており、再帰自体の貢献が不明瞭だった。μVLAはメモリトークンとTBPTTのみを導入し、他の要素を排除することで、再帰の能力限界を明確にした。この結果は、部分観測下での操作タスクにおいて、最小限の再帰が有効な領域と、追加のメモリ構造が必要な領域を区別するものであり、今後のVLA設計の指針となる。 本紙の過去報道との接続はないが、VLAモデルの発展という文脈では、ロボット操作における部分観測問題への対処が重要な課題である。μVLAの結果は、再帰が万能ではなく、タスクに応じたメモリ構造の選択が重要であることを示唆する。業界構造への含意としては、VLAモデルの実用化において、センサ情報が不完全な環境でのロバスト性向上に寄与する可能性がある。一方、未確定の論点として、実ロボットでの検証や、より複雑なタスクでのスケーラビリティが挙げられる。
なぜ重要か
この研究は、VLAモデルにおける再帰メモリの効果を切り分けた点で学術的に重要であり、部分観測環境でのロボット操作の信頼性向上に寄与する可能性がある。実世界のロボットは完全な状態を観測できないことが多く、μVLAの知見は実用化に向けた設計選択に影響を与えるだろう。