何が起きたか

RIFARは2026年10月2日、継続ロボット学習向けの手法「Reliability and Forgetting-Aware Replay for Continual Robot Learning」を公表した。限定的なデモンストレーションの前半部分から過去の軌跡を再構成し、凍結した逆ダイナミクスモデルで行動と視覚の整合性を判定する点が特徴である。評価ではLIBEROの3系列と実機実験で、従来のWAMベース生成再生より高い性能を示した。

詳細

手法は、コンパクトなデモンストレーションのprefixから軌跡を再構成し、まず現在の実演データと品質の高いスクリーン済み軌跡を組み合わせて学習する。その後、同じ過去入力に対して適応前後の行動予測の差を比較し、正規化されたドリフトが大きい軌跡を同じ候補プールから再選別して継続学習に用いる。 性能面では、LIBERO-GoalでAUC90.97を記録し、保持した履歴は1タスクあたり320 historical time stepsであった。原典では、これは50-demonstration replayで保持されるステップ数の約4.9%に相当するとしている。

Key Facts

RIFARは、reliability screeningとdrift-aware replay selectionを組み合わせる手法である。[1]
凍結したinverse-dynamics modelを使い、action-visual consistencyを評価する。[1]
学習はcurrent demonstrationsとscreened trajectoriesを組み合わせ、その後にnormalized driftの大きい軌跡を再選別する。[1]
評価はthree LIBERO suitesとreal-world experimentsで行われた。[1]
LIBERO-Goalで90.97 AUC、保持は1 taskあたり320 historical time stepsで、50-demonstration replayの約4.9%だった。[1]

本紙の見方

RIFARの新しさは、単に過去データを再生するのではなく、軌跡の妥当性を行動・視覚の整合性と、適応後に生じる予測ドリフトの両方で選別している点にある。経験再生そのものは継続学習の既定路線だが、完全な実演の保存コストが増えるという制約に対し、prefixだけを使って過去軌跡を復元し、さらに同一入力に対する前後差で再選別する構造は、記憶容量の節約と忘却抑制を同時に狙う設計である。 本紙の関連記事はないため、過去報道との連続性は置けない。ただし本件は、ロボット学習でしばしば切り分けられてきた「再生データの圧縮」と「適応による性能劣化対策」を一つの選択機構に束ねた点に意味がある。WAMベース生成再生という枠組みの中で、見た目が整ったロールアウトをそのまま採るのではなく、凍結した逆ダイナミクスモデルで動作可能性を確認するため、生成品質と実行可能性のギャップが焦点になる。 業界構造への含意は、学習用メモリの節約が単なる保存容量の問題ではなく、どの軌跡を残すかという選別アルゴリズムの問題に移っている点にある。LIBEROの3系列と実機実験で結果を示した以上、今後の比較軸は保持ステップ数だけでなく、再選別の安定性、適応前後のドリフト定義、逆ダイナミクスモデルへの依存度に広がるとみられる。特に、320ステップという圧縮がどのタスク難度まで維持できるか、50-demonstration replayとの公平な比較条件がどう設定されているか、実機での再現性がシミュレーションと一致するかが未確定論点である。

なぜ重要か

RIFARは、ロボットが蓄積経験をそのまま保存する負担を減らしつつ、過去技能の崩れを抑える選択肢を示した点で意味がある。発表元のarxiv.orgによれば、LIBERO-Goalで90.97 AUCを保ちながら履歴を1タスク320ステップに抑えており、学習データの保持方法が性能と容量の両方に関わることが具体的に示された。