何が起きたか

arXivは2026-09-26に、論文「RE-0: Verified Recursive Improvement of Embodied Code-as-Policy Agents through Local On-Policy Distillation」を公開した。論文は、Code-as-Policyエージェントが長期の身体性タスクをコード生成と実行でこなす一方、全体としては信頼できない教師を使って継続的に性能を上げる難しさに対し、RE-0とRE-OPDという改善枠組みを提案している。要点は、教師の全体行動ではなく、学生自身の失敗履歴に対する局所修正を環境内で検証し、効果が確認された介入だけを学習に使う点にある。

詳細

RE-0では、教師に対して学生の失敗履歴に基づく局所修正を求め、その修正が環境内で本当に有効かを確認する。検証済みの修正は即時の改善につながると位置づけられている。 RE-OPDは、その検証済み介入をオンポリシーの蒸留に変換する枠組みである。論文では、反事実的に検証された教師介入だけを分布レベルの監督として使い、その寄与を局所的な利益で重み付けし、得られた改善を単独の学生に投影すると説明している。さらに、学生のラウンドごとの改善幅が、検証と投影の誤差項を除けば検証済み介入の改善幅に下駄を履かせた形で下限づけられると証明したとしている。

Key Facts

arXivは2026-09-26に論文「RE-0: Verified Recursive Improvement of Embodied Code-as-Policy Agents through Local On-Policy Distillation」を公開した。[1]
論文はRE-0という、教師の全体的な優位性を仮定せず、学生の失敗履歴に対する局所修正を環境内で検証する改善枠組みを提案した。[1]
論文はRE-OPDという、検証済みの教師介入のみを使ってオンポリシー蒸留を行う枠組みも提案した。[1]
論文は、学生の1ラウンド当たりの改善幅について、検証と投影の誤差項を除いて下限を与えると主張した。[1]
複数のCode-as-Policy身体性タスクで、RE-0は教師支援時の実行と単独学生の双方を改善し、未知のロボットやシーンにも一般化したとしている。[1]

本紙の見方

この論文の新しさは、教師モデルを「常に学生より優れるもの」とみなさず、学生側の失敗に対して局所的に修正を当て、その効果を環境内で確かめたものだけを学習信号にする点にある。従来の蒸留や模倣では、教師の振る舞い全体を正解として扱うため、教師が失敗した場面まで誤って模倣する危険があったが、RE-0はその前提を外している。ここは単なる蒸留手法の微修正ではなく、どの行動を監督に使うかという信用配分の設計を変えている。 本紙の過去報道は与えられていないため、既報との比較はできない。ただし、論文内のRE-0とRE-OPDの関係を見ると、前者が「有効な局所修正を見つける探索・検証」の役割、後者が「検証済み介入を分布レベルの学習へ戻す」役割を担っており、改善の生成と学習の伝播を分けている構造が読める。つまり、学生の失敗→教師の局所修正→環境での検証→蒸留→学生更新、という循環を閉じようとしている。身体性タスクでは、単なるオフライン模倣よりも、実環境での有効性確認が性能維持に直結しやすいとみられる。 業界構造への含意としては、ロボットやエンボディドAIの学習で、データ量そのものよりも「どの介入を信用できるか」がボトルネックになっている点が明確になる。特に、教師がグローバルに信頼できない場面では、全軌跡を丸ごと学習させるより、失敗状態に限定した局所介入のほうがサンプル効率や安全性の面で合理的になり得る。もっとも、論文が示したのは複数タスクでの改善であり、実運用でどの程度の失敗状態を検証できるか、環境内チェックのコストがどれほど増えるか、学生への改善がどのタスクでも安定するかは未確定である。 次に確認すべき論点は、検証に要する試行回数、教師介入の選別基準、RE-OPDが依拠する局所利益の算定方法、そして未知ロボットや未知シーンへの一般化がどの程度の範囲で再現されるかである。論文要旨だけでは、計算コストと性能向上の交換条件までは読めない。

なぜ重要か

この論文が示すのは、身体性AIの学習で「教師の模倣」ではなく「環境で検証された修正」だけを使う設計があり得るという点である。発表元のarXivによれば、RE-0は教師支援時の実行と単独学生の双方を改善し、未知のロボットやシーンにも一般化したとしており、適用条件は局所修正を環境内で確認できることにある。