何が起きたか
arxiv.orgに2026年6月13日付で投稿された論文「MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation」は、映像世界モデルポリシーにエピソード記憶機構を統合する手法を提案した。同手法はLIBERO-Memベンチマークで平均成功率を5%から42.5%に改善し、実ロボットでは計数タスクで78.3%、空間記憶で80.0%、逐次追跡で75.0%の成功率を達成した。
詳細
MemoryVAMは、Recap-Cue (RC)モジュールを導入する。Recap CompressorはPerceiverベースで、フレームごとのCLIP埋め込みをコンパクトなメモリトークンに変換する。Cue Gateはメモリと言語からタスク完了度を推定する軽量モジュールである。これらのトークンはビデオバックボーンとアクションデコーダの両方に注入され、ポリシーの想像とエピソード進行を整合させ、履歴に基づく行動条件付けを実現する。記憶モジュールはビデオ予測、デルタ再構成補助損失、エピソード境界監視で訓練され、フレームごとの進捗ラベルを必要としない。同じ機構はクロスアテンション注入インターフェースの変更のみでUNetとDiffusion Transformer (DiT)バックボーンの両方に適用できる。
Key Facts
| MemoryVAMは、映像世界モデルポリシーにエピソード記憶機構を統合する手法である。 | [1] |
| LIBERO-Memベンチマークで平均成功率を5%から42.5%に改善した。 | [1] |
| 実ロボットでは、計数タスクで78.3%、空間記憶で80.0%、逐次追跡で75.0%の成功率を達成した。 | [1] |
| 記憶モジュールはビデオ予測、デルタ再構成補助損失、エピソード境界監視で訓練され、フレームごとの進捗ラベルを必要としない。 | [1] |
| 同じ機構はUNetとDiffusion Transformer (DiT)バックボーンの両方に適用できる。 | [1] |
本紙の見方
今回の提案は、映像世界モデルポリシーにおける長期的な操作タスクの非マルコフ性に対処する点で新規性がある。従来の映像世界モデルは短い観測ウィンドウのみに条件付けされ、過去のイベントに依存する行動が取れないという課題があった。MemoryVAMはエピソード記憶を導入することで、この制約を緩和し、長期的な依存関係を扱えるようにした。これは、ロボット操作における映像予測と行動生成の統合という研究の流れにおける一歩と位置づけられる。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、映像世界モデルポリシーの発展という観点では、近年のロボット学習における基盤モデル活用のトレンドと連続する。MemoryVAMは、記憶機構を追加することで、タスクの進捗に応じた行動生成を可能にし、従来の短期的な予測に基づく手法の限界を克服しようとする試みである。 業界構造への含意としては、ロボット操作の学習手法において、記憶と予測の統合が重要な研究方向になる可能性がある。特に、実ロボットでの成功率が高いことは、実世界での応用可能性を示唆する。ただし、論文は特定のタスクセットでの評価であり、汎用性やスケーラビリティについてはさらなる検証が必要である。 未確定の論点としては、MemoryVAMの記憶機構がどの程度の長期的依存関係を扱えるのか、また、異なるタスクや環境での汎化性能が不明である。さらに、実ロボットでの評価は特定のタスクに限定されており、より複雑な操作タスクでの有効性が焦点になる。また、記憶トークンの設計や訓練方法の詳細が、他の手法と比較してどの程度優位性を持つのかも検証が必要である。
なぜ重要か
MemoryVAMは、ロボット操作における映像世界モデルの記憶能力を拡張し、長期的なタスクの成功率を大幅に向上させた。これは、実世界の複雑な操作タスクへの応用可能性を示すとともに、映像予測と行動生成の統合研究に新たな方向性を提示する。今後のロボット学習システムの設計において、記憶機構の重要性が増すことを示唆している。