日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
身体化エージェントarXiv:2608.11350v1

スキル進化による自己進化型身体化エージェント

Self-Evolving Embodied Agents via Skill-Harness Evolution

シェア:XThreadsFacebookLINEはてブBluesky

モデルパラメータを固定したまま、再利用可能なスキルとコンテキストコードハーネスを進化させることで、訓練なしで身体化エージェントを適応させるフレームワークSHAPERを提案した。

詳しい要約

1. どんなもの?

本論文は、基盤モデルを中心に構築された具現化エージェント(embodied agent)の性能を、モデルパラメータを更新せずに向上させる自己進化フレームワークSHAPERを提案する。SHAPERは、凍結されたモデルをプランナーとオプティマイザの両方として利用し、再利用可能なスキルとコンテキストコードハーネスをターゲット環境でのロールアウトを通じて進化させる。これにより、追加のデータ、報酬、トレーニングを必要とせず、固定インターフェース設定でも動作する。

2. 先行研究と比べてどこがすごい?

従来の教師ありファインチューニングや強化学習は、追加データ、報酬、トレーニングランを必要とし、環境適応にコストがかかる。また、多くのトレーニング不要のコード中心アプローチは、プログラム可能なロボットAPIに依存しており、固定インターフェース設定では利用できない。SHAPERは、モデルパラメータを凍結したまま、非パラメトリックなエージェントシステム(スキルとコンテキストコードハーネス)を進化させることで、これらの制約を克服し、トレーニング不要で固定インターフェースにも適用可能な点が新しい。

3. 技術・手法の肝は?

SHAPERの核心は、凍結されたモデルがプランナーとオプティマイザの両方の役割を果たすことにある。具体的には、エージェントはターゲット環境でのロールアウトを通じて、再利用可能なスキルとコンテキストコードハーネスを進化させる。スキルはタスク実行のための再利用可能な手順や知識を表し、コンテキストコードハーネスはモデルの推論を支援するコードやコンテキストを提供する。これらを進化させることで、モデルパラメータを更新せずにエージェントの性能を向上させる。

4. どうやって有効だと検証した?

VLABenchとESI-Benchの2つのベンチマークで評価し、異なる低レベルアクションインターフェースを持つ具現化エージェントを対象とした。比較対象は、純粋な実行、教師ありファインチューニング、およびテスト時スケーリングのベースライン(verifier-free selectionやvotingなど)である。結果は、スキルとハーネスの最適化が、モデルトレーニングが高価、利用不可能、または望ましくない場合に、自己進化する具現化エージェントへの実用的な経路であることを示唆している。

5. 議論はある?

要旨からは、SHAPERの限界や潜在的な欠点についての議論は不明である。ただし、提案手法はモデルパラメータを凍結するため、モデル自体の知識や能力の限界がエージェントの性能上限を決める可能性がある。また、スキルとハーネスの進化がどのように収束するか、複雑なタスクでのスケーラビリティなどが議論の余地がある。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、supervised fine-tuning、reinforcement learning、train-free code-centric approaches、test-time-scaling baselines(verifier-free selection、voting)が挙げられる。次に読むべき論文としては、これらの手法の詳細を扱った論文や、VLABench、ESI-Benchのベンチマーク論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

分類: cs.CL, cs.RO

原文アブストラクト

Embodied agents are increasingly built as systems around foundation models, where performance depends not only on model weights but also on the skills, context, action interfaces, and execution harness surrounding the model. While supervised fine-tuning and reinforcement learning can adapt agents to new environments, they require additional data, rewards, and training runs; meanwhile, many train-free code-centric approaches rely on programmable robot APIs that may be unavailable in fixed-interface settings. We propose SHAPER, a self-evolving framework for train-free embodied adaptation that keeps model parameters frozen and improves the non-parametric agent system by evolving reusable skills and a context-code harness through target-environment rollouts. In SHAPER, the same frozen model can serve as both planner and optimizer, refining its external skills and context-code harness without parameter updates. We evaluate SHAPER on VLABench and ESI-Bench, covering embodied agents with different low-level action interfaces, and compare against pure execution, supervised fine-tuning, and test-time-scaling baselines such as verifier-free selection and voting. Our results suggest that skill-and-harness optimization is a practical route to self-evolving embodied agents when model training is expensive, unavailable, or undesirable.