何が起きたか

arXivは2026-09-29、RoboHarn-Evoと題する論文を公開した。論文は、基盤モデルを更新せずに、物理経験から階層的な物理知識(Hierarchical Physical Knowledge, HPK)を発展させる双方向ループのハーネスを提案している。実験では、RMBenchで複数のエージェントモデルに対して平均成功率が最大24.2ポイント向上した。

詳細

HPKは2層で構成される。Task Knowledgeは「どのサブタスクをいつ終えたか」を扱い、Action Knowledgeは対象物に対する幾何学的な戦略とその物理効果を扱う。実行時には、エージェントが意思決定レベルに応じた知識を検索し、現在の場面とタスク目標に合わせて接地する。 論文によると、80回のinteraction rolloutsで、held-out successはGPT-5.5で48.3%から75.0%へ、GPT-6で70.0%から88.3%へ上昇した。また、RoboHarn-Evoは歴史的な知識誤りの83%以上を解消しつつ、有効な知識の95.8%を保持し、RMBenchからRoboDojoへzero-shotで転移して35.0ポイントと25.0ポイントの改善を示した。

Key Facts

RoboHarn-Evoは、物理経験から階層的な物理知識(HPK)を発展させる双方向ループのハーネスである。[1]
HPKはTask KnowledgeとAction Knowledgeの2層で構成される。[1]
RMBenchでの実験では、複数のエージェントモデルに対する平均成功率が最大24.2ポイント改善した。[1]
80回のinteraction rolloutsで、GPT-5.5のheld-out successは48.3%から75.0%へ上昇した。[1]
同じ条件で、GPT-6のheld-out successは70.0%から88.3%へ上昇した。[1]

本紙の見方

この論文の新規性は、ロボット操作の性能改善を基盤モデルの再学習ではなく、実行中に得た物理フィードバックを知識として再編する点にある。Task KnowledgeとAction Knowledgeを分け、意思決定の段階ごとに呼び出して更新する設計は、単なるメモリ拡張ではなく、試行の履歴を再利用可能な操作知へ変換する枠組みだと読める。一方で、あくまで実験系はRMBenchとRoboDojo上での検証であり、実世界での長期運用までを示したものではない。 本紙の見方では、注目点は「性能が上がった」こと以上に、どの種類の失敗が減ったかである。論文は歴史的な知識誤りの83%以上を解消し、有効な知識の95.8%を保持したとしており、忘却を抑えつつ誤りを修正する方向に効いている。これは、ロボットの操作知を一回限りの軌跡ではなく、再利用可能な手続きとして蓄積する発想と整合的である。ただし、どのタスクで改善が大きかったか、知識更新の頻度や停止条件がどう設計されたかは、要約だけでは判断しづらい。 業界構造への含意としては、学習データの量だけでなく、実機との相互作用から得た知識をどう保存し、どう検索し、どう更新するかが差別化要因になる可能性がある。とくに「基盤モデルを更新しない」運用は、モデル再学習のコストや版管理の複雑さを避ける設計として読めるが、代わりに知識ベースの品質管理が重要になる。次に確認すべき論点は、どのロボット本体やセンサー条件で再現したのか、知識誤りの判定基準、そしてRoboDojoへの転移がどの程度一般化するかである。

なぜ重要か

基盤モデルを再学習せずに、物理相互作用を知識として蓄積する設計は、ロボット操作の改善を「学習し直す」工程から「経験を整理して再利用する」工程へ寄せる。論文が示したのは、RMBenchで最大24.2ポイント、RoboDojoでzero-shot転移による35.0ポイントと25.0ポイントの改善であり、反復実行の中で知識管理が効く余地を示している。