何が起きたか

arXivは2026-09-26、RoboFoundry: System-as-Policy Evolution for Self-Learning Embodied Agentsを公開した。論文は、実体エージェントを個別機能の最適化ではなく、支えるシステム全体を一つの政策として扱う枠組みを提案している。EmbodiedBenchではGPT-5.5を27.8%上回り、Qwen3.7-Plusは72.7%に対して70.3%まで迫ったとしている。

詳細

RoboFoundryは、決定と記憶管理の能力ギャップを診断し、実行トレースを検証済みのタスク特化システム更新に変換し、反復的な改善を一般システムへ促す設計である。進化は、アクティブな内部コンテキストと永続的なファイルシステム記憶を管理するcontext systemと、原子的スキル、再利用可能な合成、失敗条件付き回復を整理するhierarchical skill systemの2面で進む。さらに、shared semantic interfaceにより、身体に依存しない判断とロボット固有の実行を分離し、異種ロボット間で evolved system capabilities を移しやすくするとしている。 性能面では、EmbodiedBenchでstate-of-the-artを達成し、GPT-5.5を27.8%改善したと記載している。RoboMemArenaでは、外部foundation modelsを補助に使う手法を含む全ベースラインを少なくとも39.0%上回ったとしている。LIBERO-PROでは、Cap-Agent0に対して全てのperturbation typesで243.8%-679.7%上回ったと述べている。

Key Facts

RoboFoundryは、実体エージェントの支援システム自体を「Self-Evolving System-as-Policy」として扱う枠組みを提案した。[1]
論文は、実行トレースを検証済みのタスク特化システム更新に変換し、反復的な改善を一般システムへ促す設計だとしている。[1]
進化の対象は、context systemとhierarchical skill systemの2面である。[1]
EmbodiedBenchでGPT-5.5を27.8%上回り、Qwen3.7-Plusは70.3%でGPT-5.5の72.7%に近づいたとしている。[1]
RoboMemArenaでは少なくとも39.0%、LIBERO-PROではCap-Agent0に対して243.8%-679.7%上回ったとしている。[1]

本紙の見方

RoboFoundryの新しさは、実体エージェントの性能改善を「記憶」「技能」「行動インターフェース」の個別最適化としてではなく、支援システムそのものを更新対象に置いた点にある。論文は、実行経験を永続的で検証済みのシステム変更へ変換し、その変更を再利用する循環を設計の中心に据えており、単発の推論精度向上よりも、継続学習の仕組み化が主題である。これは既存のエージェント改善の延長に見える部分もあるが、少なくとも記述上は「エージェントが何をするか」より「エージェントのシステムがどう進化するか」を政策化している点が違う。 技術的には、context systemとhierarchical skill systemを分け、さらにshared semantic interfaceで身体非依存の判断とロボット固有の実行を切り分けている。この構造は、単一ロボット向けの局所最適ではなく、異種ロボットへ能力を移す前提を置いているため、学習済みの技能や回復手順の移植性が焦点になる。一方で、論文の主張はベンチマークと実機デプロイの両方にまたがるが、公開文面からは、どの程度のロボット種別、どのタスク群、どの失敗条件で更新が安定しているかまでは読み切れない。 ただ、今回の論文はEmbodiedBench、RoboMemArena、LIBERO-PROという異なる評価軸を同時に使っており、短期の操作性能だけでなく長期記憶と攪乱耐性まで含めた評価設計が特徴である。業界構造への含意としては、ロボット本体の性能競争だけでなく、実行ログ、永続記憶、失敗復帰、スキル再編成をどこまでソフトウェア層で閉じ込められるかが差になる可能性がある。未確定の論点は、実機でのゼロショット移転の対象ロボット数、オンライン進化の更新頻度、学習に使った実行痕跡の規模、そして安全性の検証方法である。

なぜ重要か

論文の記述通りであれば、実体エージェントの改良点は単体モデルの性能より、実行履歴をどう永続化し再利用するかに移る。これは、ロボットを導入する側にとって、機体更新だけでなく記憶・技能更新の運用設計が必要になることを意味する。

日本への影響

日本では、ロボットの本体性能だけでなく、実行ログを用いた継続改善や異機種間での能力移植をどこまで実装できるかが論点になりうる。論文はshared semantic interfaceで身体に依存しない判断とロボット固有の実行を分離しており、複数機種を扱う現場ほどこの設計の適否が問われる。