何が起きたか

RACaPは2026年9月24日、arXivで公開された。一般目的のロボットエージェント向けに、推論と行動を分けつつ、実行時にコードを書き換えるのではなく、固定化したTyped Policy APIsを呼び出す設計を採る。評価ではLIBERO-90で54.4%、ゼロショットのLIBERO-PROで45.0%、LIBERO-Longで46.0%の成功率を記録した。

詳細

論文は、CaP(Code as Policies)が実行時にプログラムを生成・修復するため遅延が生じ、再利用可能な機構とタスク固有の判断が絡み合うと指摘する。その代わりにRACaPは、実装済みの政策APIを呼び出すReActループを採用し、タスクごとの作業記憶、長期の経験記憶、視覚フィードバックで行動選択・結果確認・失敗回復を行うとしている。 学習面では、能力カリキュラム学習と自律的な自己進化を組み合わせ、API、ReActのハーネス、経験記憶を改良する二段階戦略を取る。推論効率では、拒否サンプリングによる微調整でGPT-5.6のReAct判断をQwen3-VL-8B-Instructに蒸留し、1意思決定あたりの推論速度を13.2倍に高め、実機での物理呼び出し回数を16回から4回に減らしたとしている。

Key Facts

RACaPは「Agentic Reasoning, Acting, and Coding as Policies for Evolvable Robot Learning」の手法である。[1]
RACaPは固定したTyped Policy APIsとReActループを組み合わせる。[1]
LIBERO-90で54.4%、ゼロショットのLIBERO-PROで45.0%、LIBERO-Longで46.0%の成功率を記録した。[1]
LIBERO-PROではCaP系ベースライン比で2.5倍の成功率と、中央値のポリシー時間で1.9倍の高速化を示した。[1]
GPT-5.6のReAct判断をQwen3-VL-8B-Instructに蒸留し、1回あたりの推論速度を13.2倍に高めた。[1]

本紙の見方

RACaPの新しさは、ロボット方策を実行時に都度“書く”のではなく、事前に凍結したAPIとして切り出し、その上でReActが状況判断だけを担う点にある。CaP系の弱点として論文が挙げるのは、プログラム生成・修復の遅延と、再利用可能な機構とタスク固有の決定の混線である。つまり今回の焦点は、モデルの能力そのものよりも、能力を呼び出すインターフェース設計と記憶の分離にあるとみられる。 本紙の過去報道との接続はないため、今回はこの論文単独で読む必要がある。もっとも、二段階戦略でAPI、ReActハーネス、経験記憶を同時に更新する設計は、単発のタスク達成よりも継続学習と再利用を重視している点で、長期タスクの成功率改善と整合的である。LIBERO-Longで46.0%、CaPベースラインが最大4.0%という差は、長い手順ほど“その場でコードを作る”方式の不利が出やすいことを示唆する。 業界構造への含意としては、ロボット学習のボトルネックが、エンドツーエンドの方策性能だけでなく、推論レイテンシ、失敗回復、経験記憶の扱いに移っている点が重要である。特に1意思決定あたり13.2倍の高速化や、物理呼び出し16回から4回への削減は、実機運用での試行コストと時間コストに直結する。一方で、論文が示す数値はLIBERO系ベンチマークに限られるため、実環境でどこまで再現するか、蒸留後のQwen3-VL-8B-Instructがどの条件で性能を落とすか、経験記憶の更新が安全性や失敗回復にどう効くかは未確定である。

なぜ重要か

この研究は、ロボットの判断を巨大モデルの逐次推論に頼り切らず、再利用可能な機構をAPI化して実行時コストを下げる設計を示している。論文が示した13.2倍の推論高速化と物理呼び出し回数の削減は、長期タスクの実機適用で重要な制約である待ち時間と試行回数に関係する。