何が起きたか

arXivに2026-09-28付で掲載された論文「ReCAT: Remember, Count, and Time」は、ロボット操作向けに構造化再帰記憶を組み込んだ、言語条件付き方策を提案した。論文は、現在の観測を扱うエンコーダ、Mamba-2層と1つの因果注意層からなる再帰記憶、そして現在と過去の表現を別々のクロスアテンションで読むFlow-matching Transformerデコーダで構成される。評価では、LIBEROで平均95.3%、RMBenchで62.4%の成功率を示し、9課題中6課題で最良または同率最良となった。

詳細

論文は、記憶依存の操作では、現在のセンサーだけでは得られない情報を使って判断する必要があると整理している。例として、以前の視覚手がかりの想起、タスク進捗の追跡、反復イベントの計数、経過時間の推定を挙げている。 実機評価は3課題で行われ、空間想起、イベント計数、時間間隔の推定を対象にした。最良のReCAT変種は平均成功率66.7%を記録し、最も強い短履歴ベースラインの8.3%を上回った。制御比較では、観測エンコーダと、各ブロックでの記憶条件付けがこの性能に必要だと論文は示している。また、効率的な系列モデリング向けに開発された更新規則はロボット記憶では挙動が異なり、加算更新は計数と時間推定で、デルタ規則更新は空間想起で、それぞれ観測された成功率が最も高かった。

Key Facts

論文名は「ReCAT: Remember, Count, and Time: Structured Recurrent Memory for Robot Manipulation」である。[1]
掲載日は2026-09-28で、媒体はarXivである。[1]
ReCATは、観測エンコーダ、Mamba-2層と1つの因果注意層を含む再帰記憶、Flow-matching Transformerデコーダで構成される。[1]
評価結果はLIBEROで平均95.3%、RMBenchで62.4%であり、9課題中6課題で最良または同率最良だった。[1]
実機3課題では平均66.7%で、最強の短履歴ベースラインの8.3%を上回った。[1]

本紙の見方

ReCATの新規性は、単に長い履歴を持たせるのではなく、ロボット操作に必要な「記憶」を、観測の取り込み、継続的な状態更新、出力生成の3段に分けて設計している点にある。Mamba-2層と因果注意を使う再帰記憶、さらに現在と過去の表現を別々のクロスアテンションで読むデコーダという構成は、言語条件付き方策の中に時系列の保持機構を明示的に埋め込む試みだといえる。一方で、論文が示すのはあくまで特定のベンチマークと実機課題での結果であり、汎用的なロボット制御全般への有効性まではまだ断定できない。 本紙の過去報道との接続はないが、今回の論文は、ロボットが「今見えているもの」だけでなく、過去の出来事を数える、順序を保つ、経過時間を扱う、といった状態推定を必要とする場面を明確に切り出している点が重要である。ここでの焦点は、単なる成功率ではなく、どの更新規則がどの記憶課題に効くかを分けて検証した点にある。加算更新が計数と時間推定で、デルタ規則更新が空間想起で相対的に強かったという結果は、記憶機構の設計が一枚岩ではないことを示す。 業界構造への含意としては、ロボット操作モデルの競争軸が、視覚認識や言語理解だけでなく、過去の状態をどう保持し、いつ参照するかという記憶設計に移りつつある点が読み取れる。これは、学習データの収集方法や評価ベンチマークの設計にも影響する可能性がある。特に、空間想起、計数、時間間隔という3種類の課題で性能差が出ているため、今後は「記憶付きロボット」と一括りにせず、どの記憶能力を狙うのかを分けて比較する必要があるとみられる。未確定の論点は、実機3課題の具体的なタスク条件、モデル規模、学習データの内訳、他の長期記憶手法との比較設定である。

なぜ重要か

この論文は、ロボット操作で問題になる「見えなくなった情報」を、構造化された記憶として扱う設計案を示した点に意味がある。LIBERO、RMBench、実機3課題という異なる条件で結果が示されており、単一ベンチマークだけでは測れない記憶能力の差を検証する枠組みとして読める。

日本への影響

日本のロボット研究や実機検証では、空間想起・計数・時間推定のような記憶依存課題をどう評価するかが論点になりうる。特に、操作中の状態保持を重視する設計では、視覚認識だけでなく時系列記憶の評価系を整える必要があるとみられる。