日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.37810

探索・実行・進化:身体性エージェントのためのスキル獲得と再利用ループ

Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied Agents

シェア:XThreadsFacebookLINEはてブBluesky

視覚と言語に触覚を組み合わせ、スキルライブラリを進化的に更新しながら再利用する枠組みRoboSkillを提案し、ロボットタスクの成功率向上と実行時間短縮を実現した。

詳しい要約

1. どんなもの?

- 視覚言語行動モデルやworld-actionモデルの汎化困難を背景に、汎用マルチモーダルエージェントのzero-shotロボットタスク解決の高コストを削減する枠組みRoboSkillを提案。 - Explore, Execute, Evolveループでskillの獲得と再利用を接続。 - エージェントは探索でタスク関連情報を収集し、フィードバックに適応しながら実行し、実行記録に基づきskill libraryを進化させる。 - 次サイクルでskillを再利用し探索と実行を導くことでループを閉じる。

2. 先行研究と比べてどこがすごい?

- 従来のvision-language-action/world-actionモデルは未見タスクへの汎化が難しく、汎用マルチモーダルエージェントはzero-shotで可能性を示すが物理世界をゼロから推論・探索するため実行コストが高い。 - RoboSkillはskill獲得と再利用をループ化し、探索・実行のコストを削減する点が異なる。 - 視覚に触覚フィードバックを補完し物理相互作用の不確実性を低減、テキストガイダンスに再利用可能コードを追加しskill再利用時の推論オーバーヘッドを削減。

3. 技術・手法の肝は?

- Explore, Execute, Evolveループ:探索でタスク関連情報を収集、実行でフィードバックに適応、実行記録からskill libraryを進化、次サイクルでskillを再利用。 - 視覚+触覚フィードバックで物理相互作用の不確実性を低減。 - テキストガイダンス+再利用可能コードでskill再利用時の推論オーバーヘッドを削減。 - これらによりループ効率を改善。

4. どうやって有効だと検証した?

- LIBERO-10で4つのエージェントに対し、初回エピソード成功率を12.5–25.0 percentage points改善、平均runtimeを7.6–72.4%削減。 - 実ロボットで成功率を8.3 percentage points改善、成功試行の平均runtimeを少なくとも14.4%削減。

5. 議論はある?

- 要旨からは不明。 - 限界や失敗事例、触覚・コード再利用の寄与の詳細な分析、計算資源や安全性への議論は要旨に記載なし。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:vision-language-action models、world-action models、general-purpose multimodal agents。 - 関連手法:LIBERO-10ベンチマーク。 - 同分野の定番:zero-shot robotic task solving、skill library、tactile feedback、code reuse for reasoning。 - 具体的な論文名は要旨からは不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Sicheng Xie, Yitong Chen, Haidong Cao, Shunlin Lu, Zuxuan Wu, Yu-Gang Jiang

分類: cs.RO, cs.AI

原文アブストラクト

Vision-language-action and world-action models have demonstrated impressive capabilities in robotics, yet generalization to unseen tasks remains challenging. More recently, general-purpose multimodal agents have shown great potential for zero-shot robotic task solving. However, they often incur high execution costs by reasoning and exploring the physical world from scratch. To reduce these costs, we introduce RoboSkill, a framework that connects skill acquisition and reuse through an Explore, Execute, Evolve loop. Within this loop, the agent explores to gather task-relevant information, executes tasks while adapting to feedback, and evolves its skill library based on execution records. It then reuses these skills to guide exploration and execution in the next cycle, closing the loop. To improve loop efficiency, we complement vision with tactile feedback to reduce uncertainty during physical interaction. We further augment textual guidance with reusable code to reduce reasoning overhead during skill reuse. On LIBERO-10, RoboSkill improves first-episode success rates by 12.5--25.0 percentage points and reduces average runtime by 7.6--72.4% across four agents. On real robots, it improves success rates by 8.3 percentage points and reduces average runtime for successful trials by at least 14.4%.

関連論文

PR本紙発行元 EmplifAI