何が起きたか

2026年8月15日にarXivに公開された論文(識別番号: 2608.15269v1)で、研究者らはロボットの長期行動ポリシー向けのプラグアンドプレイ型モジュール「Remember Smarter (RS)」を発表した。RSは視覚履歴圧縮と双曲経験記憶の2つの補完的なブランチを持ち、視覚言語行動(VLA)モデルのコンテキストを拡張せずに、最近の観察と再利用可能な経験へのコンパクトなアクセスを提供する。同モジュールをVLAモデル「pi0」に適用したところ、ベンチマーク「LIBERO-Plus」での総合成功率が53.6%から70.6%に向上した。

詳細

RSの視覚ブランチは、双方向空間Mambaと因果的時間Mambaを用いてマルチビューのパッチ履歴を圧縮し、残差クロスアテンションを通じて行動向けの隠れ状態にメモリを公開する。この際、VLMの視覚トークンストリームは変更されない。経験ブランチは、成功した最終層のVLM状態をポアンカレVAE空間に格納し、階層的に整理する。そして、取得した経験を測地線プロンプトトークンに非同期に変換し、行動推論をブロックしない。 論文では、RSをpi0に適応させた際の評価結果が報告されている。LIBERO-Plusでの成功率は53.6%から70.6%に向上し、実ロボット実験でも記憶保持と経験活用を評価する設計で substantial な性能向上が達成されたとしている。

Key Facts

論文は2026年8月15日にarXivで公開された(識別番号: 2608.15269v1)。[1]
モジュール名は「Remember Smarter (RS)」で、プラグアンドプレイ型。[1]
RSは視覚履歴ブランチと双曲経験記憶ブランチの2つで構成される。[1]
視覚ブランチは双方向空間Mambaと因果的時間Mambaを使用する。[1]
経験ブランチはポアンカレVAE空間に成功した最終層のVLM状態を格納する。[1]
RSをpi0に適用したところ、LIBERO-Plusでの成功率が53.6%から70.6%に向上した。[1]
実ロボット実験でも記憶保持と経験活用で substantial な性能向上が達成された。[1]

なぜ重要か

この研究は、VLAモデルのコンテキストを拡張せずに長期タスクの記憶を効率的に扱う手法を示しており、ロボットの長期行動計画の性能向上に寄与する可能性がある。具体的な数値で成功率の向上が示されており、実ロボットでの有効性も報告されている。