何が起きたか
arxiv.orgは2026-09-29、長期視覚言語行動方策向けの論文「Remember What You Did: Action-History Memory with Dual-Expert Denoising for Long-Horizon Vision-Language-Action Policies」を公開した。論文は、凍結したVLA基盤モデルに行動履歴メモリを加える「ActMem-VLA」を提案している。LIBERO-Memでは10タスク平均80.8%の成功率を示し、π0.5の65.2%、MemoryVLAの49.5%を上回ったとしている。
詳細
ActMem-VLAは、Mambaベースのメモリモジュールと軽量なPreAction Expert(PAE)を持つデュアルエキスパート方式である。Mambaが実行済み行動の履歴をメモリに符号化し、その情報を現在の文脈とともにPAEへ渡す。PAEは高ノイズの拡散過程の初期段階でタスク進行を導き、その後、部分的にデノイズされた行動を凍結されたAction Expert(AE)に渡して、低ノイズ段階で詳細を補正する。学習では、微調整済みの基盤VLAを凍結したままにし、MambaモジュールとPAEのみを共同最適化する設計である。
Key Facts
| 論文名は「Remember What You Did: Action-History Memory with Dual-Expert Denoising for Long-Horizon Vision-Language-Action Policies」である。 | [1] |
| ActMem-VLAは、凍結したVLAにMambaベースのメモリモジュールと軽量なPreAction Expert(PAE)を加える構成である。 | [1] |
| Mambaは実行済み行動の履歴をメモリ化し、PAEが高ノイズの初期デノイジングでタスク進行を導く。 | [1] |
| 学習時は基盤VLAを凍結し、MambaモジュールとPAEのみを最適化する。 | [1] |
| LIBERO-Memで10タスク平均80.8%の成功率を示し、π0.5の65.2%、MemoryVLAの49.5%を上回った。 | [1] |
本紙の見方
この論文の新しさは、長期タスクで問題になりやすい「現在の観測が似て見えるために行動が曖昧になる」状況に対し、履歴を明示的にメモリ化して拡散過程の前半と後半で役割を分けた点にある。単に過去情報を条件として足すのではなく、PAEが早い段階で進行方向を定め、AEが後段で細部を整える二段構えにしているため、履歴の使い方そのものを推論手順に埋め込んだ設計だといえる。加えて、基盤VLAを凍結し、MambaとPAEだけを学習するため、メモリを足すたびにベース方策まで再学習する従来型よりも、更新対象を切り分けた構造になっている。 本紙の関連記事はないため過去報道との接続は置かないが、今回の論文は「メモリをどう入れるか」という点で、既存のfeature conditioningやaction-prior modification、sampling guidanceとは異なる層を狙っている。既存法が時系列や進捗の手掛かりを与えるのに対し、本手法は行動履歴をメモリとして保持し、拡散の前半で方策の進行制御、後半で詳細復元を行う。これは、長期のVLAで課題となる記憶欠落と知覚あいまい性の両方に対し、推論のどの段階で何を補うかを分離した点が特徴だとみられる。 業界構造への含意としては、VLAの性能差が単なる大規模化だけでなく、履歴の保持方法とデノイジング設計に依存し始めている点が挙げられる。凍結した基盤モデルの上に小さなメモリ機構を載せる設計は、学習コストを抑えながら長期タスク対応を狙う方向を示す一方、どの程度の追加パラメータでどの種類のタスクに効くのかはまだ限定的である。特に、LIBERO-Memでの80.8%という結果が実機4課題でどこまで一般化するか、MambaとPAEのどちらが効いているのか、またベースVLAの種類を変えた場合に同じ分離構造が維持できるかが次の確認点になる。
なぜ重要か
行動履歴を明示的に使う設計は、長い手順の途中で状態が似通うロボット操作で、どの段階にいるかを見失いにくくする可能性がある。論文が示したのは、基盤VLAを大きく作り直さずに、追加パラメータ3.45%のメモリ機構で性能差を出せるかという点であり、学習コストと性能の両立を探る研究として意味がある。
日本への影響
日本企業や研究機関にとっては、長期タスク対応のVLAで基盤モデルを凍結したまま履歴モジュールを差し替える設計が、既存のロボット制御基盤に載せる際の実装方針として参考になる可能性がある。ただし、LIBERO-Memと実機4課題の結果がそのまま日本の現場に当てはまるかは別問題であり、対象タスクやベースモデルを変えた再検証が必要である。