何が起きたか

arXivに2026-09-19付で掲載された論文で、視覚・言語・行動を統合するVLA政策向けに「StateMem」を提案した。StateMemは、予測誤差を使って単一の持続メモリトークンを低ランク残差で更新し、キャッシュした接頭辞の再利用を適応的に振り分ける方式である。著者らは、訓練不要の制御器でルーティングしきい値をオンライン調整し、古い接頭辞特徴を高速補正する設計だとしている。

詳細

評価はLIBERO、RoboMemArena、実世界の操作課題で行われた。LIBEROでは平均成功率97.6%を達成し、フルリフレッシュ比でVLM接頭辞の平均更新率を20.25%下げたとしている。RoboMemArenaのOcclusionカテゴリでは、単一VLA手法の中で最良性能としてTask Success Rate 21.8%、Cumulative Success Rate 44.3%を示した。 また、実世界の操作課題6件では平均成功率が+21%だったとしている。論文は、外部メモリバンクに依存するMemoryVLAのような手法と異なり、単一状態の残差記憶とキャッシュ再利用の制御を組み合わせる点を特徴としている。

Key Facts

StateMemは、視覚・言語・行動のVLA政策向けに提案された単一状態残差記憶フレームワークである。[1]
予測誤差を使い、単一の持続メモリトークンを低ランク残差で更新する設計である。[1]
訓練不要の制御器が、ルーティングしきい値をオンラインで調整する。[1]
LIBEROで平均成功率97.6%を達成し、VLM接頭辞の平均更新率を20.25%低下させた。[1]
RoboMemArenaのOcclusionカテゴリで、Task Success Rate 21.8%、Cumulative Success Rate 44.3%を記録した。[1]

本紙の見方

StateMemの新しさは、外部メモリバンクを増やす方向ではなく、単一の持続メモリトークンを低ランク残差で更新し、さらにキャッシュ済み接頭辞の再利用をしきい値制御で切り替える点にある。つまり、記憶を別の保存領域として持つのではなく、VLA政策の内部状態そのものに履歴を圧縮して埋め込む設計であり、記憶保持と推論コストの両方をどう扱うかが主題だと読める。LIBEROで平均成功率97.6%と接頭辞更新率20.25%低下を同時に示したことは、精度と再計算頻度のトレードオフを意識した論文であることを示す。 本紙の関連記事はないため、ここでは公開論文そのものの構造だけを見る必要がある。MemoryVLAのような外部メモリ型と比べると、StateMemは保存先を増やすよりも、予測誤差に応じて内部状態を更新し、古い特徴を高速補正することで履歴を活用する設計である。この違いは、実機や長い操作列で問題になりやすい「過去情報の保持」と「推論の再計算負荷」を同時にどう抑えるか、という論点に直結する。 業界構造への含意としては、VLA政策の改善余地が、巨大な外部メモリや明示的検索だけでなく、状態表現の更新規則そのものに残っていることを示す点が大きい。LIBERO、RoboMemArena、実世界6課題という評価の並びは、シミュレーション内の成功だけではなく、遮蔽を含む課題や実機操作での履歴利用が焦点であることを示している。一方で、論文が示したのは成功率と接頭辞更新率であり、実運用に必要な推論遅延、計算資源、失敗時の回復特性、学習済みモデルへの移植性はまだ詰める必要がある。 次に確認すべきなのは、StateMemがどのVLAアーキテクチャへそのまま組み込めるのか、しきい値制御の挙動が課題ごとにどれだけ安定するのか、そして実機6課題での+21%がどのベースラインに対する改善かである。論文は性能指標を提示しているが、メモリ更新頻度の低下がどの程度の遅延削減や計算削減に対応するかは、この要約だけでは確定しない。

なぜ重要か

StateMemが示すのは、VLAの記憶機構が外部メモリの追加だけでなく、内部状態の更新方式で改善しうるという点である。論文がLIBEROで97.6%、RoboMemArenaのOcclusionで21.8% TSR、実世界6課題で+21%を示したことで、履歴を使う操作課題の評価軸が、成功率だけでなく接頭辞更新率のような再計算コストにも広がる。