何が起きたか
arXivは2026年9月29日、論文「Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied Agents」を掲載した。論文は、実体を持つエージェント向けにRoboSkillという枠組みを提案し、探索・実行・進化をつなぐ技能獲得と再利用のループを設計した。LIBERO-10では、4つのエージェントで初回エピソードの成功率が12.5〜25.0ポイント改善し、平均実行時間は7.6〜72.4%短縮したとしている。
詳細
RoboSkillは、最初に環境を探索して課題に関する情報を集め、次にタスクを実行しながらフィードバックに適応し、その実行記録を基に技能ライブラリを進化させる構成である。さらに、その技能を次の探索と実行に再利用することでループを閉じるとしている。 効率向上のため、視覚に触覚フィードバックを補完して物理的な相互作用での不確実性を下げ、文章による指示には再利用可能なコードを加えて技能再利用時の推論負荷を抑える設計だとしている。実機では成功率が8.3ポイント向上し、成功試行の平均実行時間は少なくとも14.4%短縮した。
Key Facts
| arXivは2026年9月29日に論文「Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied Agents」を掲載した。 | [1] |
| 論文はRoboSkillという、Explore, Execute, Evolveのループで技能獲得と再利用をつなぐ枠組みを提案している。 | [1] |
| RoboSkillは視覚に触覚フィードバックを補完し、物理相互作用時の不確実性を下げる設計である。 | [1] |
| RoboSkillは技能再利用時に文章指示へ再利用可能なコードを加え、推論負荷を減らすとしている。 | [1] |
| LIBERO-10では、4つのエージェントで初回エピソード成功率が12.5〜25.0ポイント改善し、平均実行時間が7.6〜72.4%短縮した。 | [1] |
本紙の見方
この論文の新しさは、単発のタスク解決性能を示すだけでなく、探索・実行・進化を一つの循環として設計した点にある。実体を持つエージェントでは、未知環境に対するゼロショット能力が注目される一方で、毎回ゼロから推論し、試行錯誤する構成は実行コストが重い。RoboSkillは、そのコストを技能ライブラリの更新と再利用で下げようとする提案であり、既存の視覚言語行動モデルや世界行動モデルの延長線上にありながら、学習後の運用形態に焦点を移している点が特徴である。 本紙の見方としては、ここで重要なのは「何ができたか」よりも「どの情報を次回に残すか」である。論文は、探索で集めた情報、実行中のフィードバック、実行記録から技能を更新し、それを次のサイクルに持ち込む。これは、実世界データをその場限りで消費するのではなく、再利用可能な形式に変換して蓄積する構造だと読める。視覚だけでなく触覚を足した点も、生成モデルの改善というより、物理接触で生じる曖昧さを減らすための入力設計として意味を持つ。 LIBERO-10での12.5〜25.0ポイント改善と、実機での8.3ポイント改善は、少なくともこの枠組みが評価環境と実環境の両方で性能差を示したことを意味する。ただし、論文要旨からは、どの種類のタスクで改善が大きかったのか、再利用可能なコードがどの程度一般化したのか、技能ライブラリがどの規模まで増えても維持できるのかは見えない。次に確認すべき論点は、技能の保存形式、再利用時の失敗条件、触覚の寄与の切り分け、そして長期運用でループが安定するかどうかである。
なぜ重要か
RoboSkillは、実機での成功率を8.3ポイント、成功試行の平均実行時間を少なくとも14.4%改善したとしており、実体を持つエージェントの運用コスト低減に関係する。論文が示すのは、視覚だけでなく触覚と再利用可能なコードを組み合わせることで、未知環境での試行錯誤を次回以降に持ち越せる可能性である。