日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/記憶arXiv:2608.15269v1

賢く記憶する:ロボット記憶のための視覚履歴圧縮と双曲経験空間

Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory

シェア:XThreadsFacebookLINEはてブBluesky

長期的なロボットポリシーのために、視覚履歴を圧縮し、経験を双曲空間で階層的に保存・活用するプラグインモジュールを提案。pi0に適用し、LIBERO-Plusで成功率を向上させた。

詳しい要約

1. どんなもの?

Remember Smarter (RS) は、ロボットの長期タスク実行を支援するプラグアンドプレイのモジュールである。視覚履歴圧縮ブランチと双曲的経験メモリブランチを備え、Vision-Language-Action (VLA) モデルのコンテキストを拡張せずに、最近の観察と再利用可能な経験へのコンパクトなアクセスを提供する。視覚ブランチは、双方向空間Mambaと因果的時間Mambaを用いてマルチビューのパッチ履歴を圧縮し、残差クロスアテンションで行動関連の隠れ状態にメモリを公開する。経験ブランチは、成功した最終層のVLM状態をPoincare VAE空間に保存し、階層的に整理し、取得した経験を測地線プロンプトトークンに変換して行動推論をブロックせずに利用する。

2. 先行研究と比べてどこがすごい?

従来のVLAモデルは、長期的なタスクにおいてコンテキストウィンドウの制約があり、過去の観察や経験を効率的に保持・利用できなかった。RSは、視覚履歴を圧縮し、経験を双曲空間に構造化して保存することで、コンテキストを拡張せずに長期メモリを実現する点が新しい。また、プラグアンドプレイで既存のVLAモデル(例:pi0)に統合でき、性能を大幅に向上させる。

3. 技術・手法の肝は?

手法の核は2つのブランチにある。視覚ブランチは、双方向空間Mambaと因果的時間Mambaを用いてマルチビューのパッチ履歴を圧縮し、残差クロスアテンションで行動関連の隠れ状態にメモリを公開する。経験ブランチは、成功した最終層のVLM状態をPoincare VAE空間に保存し、階層的に整理し、取得した経験を測地線プロンプトトークンに変換する。これにより、VLMの視覚トークンストリームを変更せずに、行動推論をブロックせずに経験を利用できる。

4. どうやって有効だと検証した?

RSをpi0に適応させ、LIBERO-Plusベンチマークで総合成功率を53.6%から70.6%に向上させた。また、メモリ保持と経験利用を評価する実ロボット実験でも大幅な性能向上を達成した。

5. 議論はある?

要旨からは、RSの限界や潜在的な欠点についての議論は不明である。ただし、プラグアンドプレイモジュールとして設計されているため、他のVLAモデルへの適用可能性や、双曲空間の表現がタスクに与える影響などが議論の余地がある。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連手法として、VLAモデル(例:pi0)、Mambaアーキテクチャ、Poincare VAE、双曲空間表現、長期ロボットポリシーに関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Dai Zhou, Jiexi Yan, Tong Li, Yuxuan Wang, Cheng Deng

分類: cs.RO

原文アブストラクト

Long-horizon robot policies require compact access to recent observations and reusable experience without expanding the vision-language-action (VLA) context. We introduce Remember Smarter (RS), a plug-and-play module with complementary visual-history and hyperbolic experience-memory branches. Its visual branch compresses multi-view patch histories using bidirectional spatial Mamba and causal temporal Mamba, then exposes the resulting memory to action-facing hidden states through residual cross-attention while leaving the VLM visual-token stream unchanged. Its experience branch stores successful final-layer VLM states in a Poincare VAE space, organizes them hierarchically, and asynchronously converts retrieved experience into geodesic prompt tokens without blocking action inference. When adapted to pi0, RS increases total success on LIBERO-Plus from 53.6% to 70.6% and achieves substantial performance gains in real-robot experiments designed to evaluate memory retention and experience utilization.