何が起きたか

研究チームは、長期記憶を必要とする非マルコフタスク向けの視覚運動ポリシーVPWEMを提案した。VPWEMは、最近の観察埋め込みをスライディングウィンドウで保持する作業記憶と、Transformerベースの圧縮器で過去の観察を固定数のエピソード記憶埋め込みに変換する機構を備える。拡散ポリシー上で実装され、MIKASAの記憶集約的操作タスクで拡散ポリシーやVLAモデルなど最先端のベースラインを20%以上上回り、モバイル操作ベンチマークMoMaRTでは平均5%の改善を達成した。

詳細

VPWEMは、スライディングウィンドウで最近の観察埋め込みを作業記憶として保持し、Transformerベースの文脈記憶圧縮器がウィンドウ外の観察を再帰的に固定数のエピソード記憶埋め込みに変換する。圧縮器は、過去の要約埋め込みのキャッシュに対する自己注意と、過去の観察のキャッシュに対する交差注意を使用し、ポリシーと共同で訓練される。拡散ポリシー上で実装され、ステップごとのメモリと計算量をほぼ一定に保ちながら、短期記憶とエピソード全体の情報を活用する。コードはGitHubで公開されている。

Key Facts

VPWEMは、作業記憶とエピソード記憶を備えた非マルコフ視覚運動ポリシーである。[1]
VPWEMは、Transformerベースの文脈記憶圧縮器を用いて、ウィンドウ外の観察を固定数のエピソード記憶埋め込みに変換する。[1]
VPWEMは拡散ポリシー上で実装され、ステップごとのメモリと計算量はほぼ一定である。[1]
MIKASAの記憶集約的操作タスクで、VPWEMは拡散ポリシーやVLAモデルなどのベースラインを20%以上上回った。[1]
モバイル操作ベンチマークMoMaRTでは、VPWEMは平均5%の改善を達成した。[1]

なぜ重要か

VPWEMは、ロボットの視覚運動ポリシーに長期記憶を組み込む新しい手法であり、従来の限界を克服する可能性を示した。これにより、長時間のタスクや複雑な環境でのロボットの自律性が向上し、実用化への道が開かれると期待される。また、拡散ポリシーとの組み合わせは、今後のロボット学習の方向性に影響を与えるだろう。