日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.08432

EMHO: 経験トレースによる身体性エージェントハーネスの最適化

EMHO: EMbodied Agent Harness Optimization via Experience Traces

シェア:XThreadsFacebookLINEはてブBluesky

身体性エージェントのモデルを固定したまま、実行トレースを分析してハーネス(計画・文脈・ツール利用)を自己進化させるフレームワークEMHOを提案し、ナビゲーションとマニピュレーションで成功率を向上させた。

詳しい要約

1. どんなもの?

- 本論文は、embodied agent の性能向上をモデル学習ではなく、周囲の agent harness(planning・context・tool use を制御する部分)の自己改善によって実現する枠組み EMHO を提案する。 - EMHO は embodied model を凍結したまま、実行 trajectory と過去の harness 履歴を分析し、harness を反復的に改訂する self-evolving framework。 - 単一 harness で複数 subtask を扱うため、episode-level の gains/losses を用いて共有 harness の共同最適化の trade-off に対処する EMHO-Merge も導入する。 - EmbodiedBench の navigation と manipulation タスクで評価し、Qwen 9B と 27B の両モデルで task success を一貫して改善した。

2. 先行研究と比べてどこがすごい?

- 従来は embodied agent の改善がモデルの training に集中し、harness は人手で engineering されるのが一般的だった。 - EMHO は harness 自体を sparse な環境 feedback 下の experience traces から直接自己改善させる点が新しい。 - 単なる skill 追加や recovery prompt の改善を超え、progress monitoring・vision tool 使用・observation grounding・failure 対応の仕方を変更する。 - 複数 subtask を単一 harness で扱う EMHO-Merge により、共有 harness の共同最適化における trade-off を扱う点も先行研究と異なる。

3. 技術・手法の肝は?

- embodied model を凍結し、harness のみを反復的に改訂する self-evolving framework。 - 実行 trajectory と prior harness history を分析して harness を更新する。 - 変更対象は skill や recovery prompt に留まらず、progress の監視方法、vision tool の使い方、observation の grounding、failure への応答方法を含む。 - EMHO-Merge では episode-level の gains と losses を手がかりに、改訂された behavior をいつ・どのように適用するかを evidence-supported に refinement する。

4. どうやって有効だと検証した?

- EmbodiedBench の navigation と manipulation タスクで評価。 - Qwen 9B と 27B の両モデルにおいて、EMHO が task success を一貫して改善することを示した。 - 定性分析により、EMHO が failure や非生産的な action からの回復を超え、embodied agent が環境を解釈し相互作用する方法自体を変えることを示した。

5. 議論はある?

- 要旨からは、EMHO の限界や失敗事例、計算コスト、harness 改訂の安定性などに関する議論は明示されていない。 - 定性分析では、EMHO が failure recovery を超えて環境解釈と相互作用を変容させることが示唆されている。 - 単一 harness を複数 subtask で共有する際の trade-off は EMHO-Merge で扱うが、その詳細な議論は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照・比較されている具体的な先行研究は明示されていない。 - 関連手法として、embodied agent の harness engineering、experience traces からの自己改善、EmbodiedBench を用いた評価、Qwen モデルによる embodied task 遂行が挙げられる。 - 同分野の定番として、embodied agent の planning・tool use・failure recovery に関する研究や、EmbodiedBench をベースにした評価論文を次に読むべき候補として挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Hyun Jung Lee, Jungtaek Kim, Jongwon Jeong, Tae-Eui Kam, Donghyun Kim, Yong Jae Lee

分類: cs.AI

原文アブストラクト

Improving embodied agents often focuses on optimizing the underlying model through training, while the surrounding agent harness that controls planning, context, and tool use is typically engineered. We ask whether this harness can instead improve itself directly from experience traces under sparse environmental feedback. We propose EMbodied Agent Harness Optimization (EMHO), a self-evolving framework that keeps the embodied model frozen and iteratively revises its harness by analyzing execution trajectories and prior harness history. EMHO optimizes beyond skills or recovery prompts, modifying how the agent monitors progress, uses vision tools, grounds observations, and responds to failures. To support multiple subtasks with a single harness, we introduce EMHO-Merge, which addresses trade-offs in jointly optimizing a single shared harness across subtasks by using episode-level gains and losses to guide evidence-supported refinement of when and how revised behaviors are applied. We evaluate EMHO on EmbodiedBench across navigation and manipulation tasks, and EMHO consistently improves task success for both Qwen 9B and 27B models. Qualitative analysis shows that EMHO goes beyond recovering from failures and unproductive actions to reshape how the embodied agent interprets and interacts with its environment.

関連論文

PR本紙発行元 EmplifAI