何が起きたか
arXivは2026-10-01、論文「Divide-and-Remember: Recursive Action-Relevant Memory for Long-Horizon VLA Policies」を公開した。論文は、現在の観測だけでは行動が決まらない履歴依存の操作タスクに対し、行動に関係する履歴情報を選んで保持する再帰型メモリ手法を提案している。RoboMMEの16の長期操作タスクでは、64トークンという制約下で平均成功率の最良結果を示したとしている。
詳細
論文では、最適なメモリは現在の観測 $o_t$ を与えたときの行動 $a_t$ とメモリ $m_t$ の条件付き相互情報量 $I(a_t; m_t \mid o_t)$ を最大化すると整理している。これに基づき、学習されるメモリ関数 $m_t = M(h_t)$ を用いる Divide-and-Remember を提案し、長い文脈を扱いながら計算を軽く保つ設計とした。 手法は、(1) 全履歴に対する選択を、$2K$ トークンから $K$ 個を選ぶ部分問題へ再帰的に分割すること、(2) すべての再帰ブロックで1つのセレクタを共有すること、の2点で構成される。論文は、固定サイズで軽量なセレクタをエンドツーエンドで学習させることで、履歴長が事実上無制限でも扱えるとしている。
Key Facts
| 論文名は「Divide-and-Remember: Recursive Action-Relevant Memory for Long-Horizon VLA Policies」である。 | [1] |
| 掲載日は2026-10-01である。 | [1] |
| 提案手法はDivide-and-Remember(D&R)で、再帰型メモリ手法として説明されている。 | [1] |
| RoboMMEは16の長期操作タスクからなるベンチマークである。 | [1] |
| 論文は64トークンの予算下で、RoboMMEにおいて平均成功率の最良結果と一貫した改善を報告している。 | [1] |
本紙の見方
この論文の新しさは、VLAモデルの「履歴をどう残すか」を経験則ではなく最適化問題として置いた点にある。従来は大きな画素変化を含むフレームを残す、といった設計に依存していたが、本論文は行動に関係する情報だけを選ぶべきだとし、条件付き相互情報量 $I(a_t; m_t \mid o_t)$ を基準に据えた。したがって主眼は、単なるメモリ拡張ではなく、観測に含まれないが行動に必要な履歴の抽出にある。 手法面では、全履歴を一度に処理せず、$2K$ トークンから$K$個を選ぶ再帰選択へ分割している点が重要だ。さらに、すべての再帰ブロックで同一のセレクタを共有するため、長い履歴に伸ばしても計算量を抑えやすい構造になっている。これは、長文脈化と軽量化を両立させるための設計であり、単にメモリ容量を増やす方向とは異なる。 RoboMMEの16タスクで64トークン予算のまま改善を示したこと、実機実験でも同様の傾向を示したことから、評価はシミュレーション内の再現性だけでなく、実機での履歴利用にまで及ぶ。もっとも、公開情報だけでは、どの種類のタスクでどの程度の改善が出たのか、セレクタの学習コストや推論時の計算量が既存法よりどれだけ小さいのかまでは分からない。今後は、タスク別の性能差、64トークンという制約がどの水準で一般化するか、実機条件での安定性を確認する必要がある。
なぜ重要か
VLAモデルで履歴を扱う際、何を保持し何を捨てるかを数理的に定義した点が、この論文の直接の意味合いである。論文は64トークンの制約下でもRoboMMEの16タスクで改善を示したとしており、長期操作で必要な記憶を限られた計算資源に収める設計が論点になる。
日本への影響
日本のロボット研究・実装にとっては、長期操作のために履歴を無制限に積むのではなく、行動に関係する情報だけを残す設計が参考になる可能性がある。とくに、実機実験でも同様の傾向が報告されているため、実機評価を重視する開発では、記憶選択の設計と評価手順が焦点になりうる。