何が起きたか

arXivは2026年10月6日、論文「EMbodied Agent Harness Optimization via Experience Traces」を公開した。論文は、埋め込み型エージェントのモデル本体を固定し、実行軌跡と過去のハーネス履歴を分析して周辺のハーネス自体を反復的に改訂する「EMHO」を提案した。対象は、計画、文脈、ツール利用を制御する仕組みである。 論文はまた、複数の下位課題を単一のハーネスで扱うための「EMHO-Merge」も導入した。EmbodiedBench上でnavigationとmanipulationの課題を評価し、Qwen 9Bと27Bの両方でタスク成功率が継続的に改善したとしている。

詳細

EMHOは、モデルの重みではなくハーネスを更新対象にする。論文によれば、更新するのは、進捗の監視方法、視覚ツールの使い方、観測の接地方法、失敗への応答のしかただ。著者らは、疎な環境フィードバックしかない状況でも、経験痕跡を使ってハーネスを自己進化させられるかを検証したとしている。 EMHO-Mergeは、episode-level gains and lossesを用いて、単一の共有ハーネスを複数サブタスクにまたがって調整する際のトレードオフに対処する設計である。論文は、EMHOが失敗からの回復にとどまらず、エージェントが環境をどう解釈し、どう作用するかまで変えると述べている。

Key Facts

論文名は「EMbodied Agent Harness Optimization via Experience Traces」である。[1]
公開日は2026年10月6日である。[1]
EMHOは、埋め込み型エージェントのモデル本体を固定したまま、ハーネスを経験痕跡から反復更新する枠組みである。[1]
EMHO-Mergeは、episode-level gains and lossesを用いて単一の共有ハーネスを複数サブタスクに適用する際のトレードオフに対処する。[1]
EmbodiedBenchのnavigationとmanipulation課題で、Qwen 9Bと27Bの双方に対して成功率改善が示された。[1]

本紙の見方

この論文の新しさは、学習対象をエージェント本体ではなくハーネスに置いた点にある。埋め込み型エージェントでは、計画、文脈管理、ツール利用が性能を左右する一方、その周辺制御はこれまで主に手作業で設計されてきた。EMHOはそこを経験痕跡から自己修正する対象に変えた。つまり、技能そのものを足すのではなく、既存の技能をどう使うかを調整する発想である。 構造として見ると、入力は実行軌跡と過去のハーネス履歴、処理はその分析、出力は進捗監視・視覚ツール利用・観測の接地・失敗応答の改訂である。EMHO-Mergeがepisode-level gains and lossesを使うのは、単一ハーネスを複数サブタスクへ横展開すると、課題ごとに有効な振る舞いが衝突しうるためだと読める。ここではモデル規模の拡大よりも、ハーネスの共有と再利用の設計が主題になっている。 ただし、EmbodiedBenchでnavigationとmanipulationの両方に効いたという点は、特定技能への局所最適ではなく、複数行動にまたがる制御改善を狙っていることを示す。Qwen 9Bと27Bの双方で改善したことからも、モデルサイズ依存の一回限りの改善ではなく、制御層の更新が再利用可能かどうかが焦点になる。 未確定の論点は、どの程度の失敗ケースで安定して効くのか、EMHOとEMHO-Mergeの差がどのサブタスクで大きいのか、そして評価対象がEmbodiedBenchに限られるのかである。論文要旨だけでは、実運用での計算コスト、更新回数、ハーネスの汎用性の境界は判断できない。

なぜ重要か

発表元の論文では、埋め込み型エージェントの改善をモデル重みの再学習ではなく、ハーネスの自己更新に移している。これは、同じ基盤モデルでも、計画やツール利用の制御で性能差が出る場合に、更新対象を絞る選択肢を示す。

日本への影響

日本のロボティクスや実世界AIで関係があるのは、認識・計画・道具利用を束ねる周辺制御の設計だとみられる。モデル本体の大型化だけではなく、実行軌跡や失敗履歴を使って行動制御を更新する発想は、現場導入時のソフトウェア構成に影響しうる。