何が起きたか
研究チームは2026年9月1日、視覚・言語・行動(VLA)モデルを長期タスクに適用するための統合フレームワーク「EmbodiedSkills」を発表した。RoboTwin 2.0の50タスクで平均成功率86.20%、LIBEROの4スイートで97.40%を達成した。一方、記憶依存のRMBenchタスクでは平均成功率12.5%にとどまった。
詳細
EmbodiedSkillsは、各スキル決定を実行提案として扱い、実行前に前提条件をチェックし、実行後に結果を検証する。共有実行可能スキルインターフェースにより、低レベルVLAポリシーをエージェントループを変更せずに交換・適応できる。また、計画・実行・検証・回復イベントを構造化軌跡として記録し、個々のコンポーネントの監視やオンライン適応に利用できる。実装にはQwen3-VLとOpenPI/pi0.5を使用し、RoboTwin 2.0とLIBEROで評価した。
Key Facts
| EmbodiedSkillsは、各スキル決定を実行提案として扱い、実行前に前提条件を検証し、実行後に結果を確認する。 | [1] |
| RoboTwin 2.0の50タスクで平均成功率86.20%、LIBEROの4スイートで97.40%を達成。 | [1] |
| 記憶依存のRMBenchタスクでは平均成功率12.5%にとどまった。 | [1] |
| 共有実行可能スキルインターフェースにより、低レベルVLAポリシーをエージェントループを変更せずに交換・適応できる。 | [1] |
| 実装にはQwen3-VLとOpenPI/pi0.5を使用し、RoboTwin 2.0とLIBEROで評価した。 | [1] |
本紙の見方
EmbodiedSkillsの提案は、VLAモデルを長期タスクに適用する際の根本的な課題に対処する点で新規性がある。従来のVLAモデルは行動予測に焦点を当てるが、長期タスクでは状態の変化に応じた認識、計画、実行、検証、回復の調整が必要となる。本フレームワークは、実行提案としてのスキル決定という概念を導入し、実行前の前提条件チェックと実行後の結果検証を組み込むことで、閉ループのエージェントシステムを構築する。 特に注目すべきは、共有実行可能スキルインターフェースの設計である。このインターフェースが固定されているため、低レベルVLAポリシーを交換・適応してもエージェントループを変更する必要がない。これは、VLAモデルの進化に伴うアップデートを容易にし、モジュール性を高める。また、計画・実行・検証・回復のイベントを構造化軌跡として記録することで、個々のコンポーネントの監視やオンライン適応が可能になる点も実用的だ。 性能面では、RoboTwin 2.0の50タスクで86.20%、LIBEROで97.40%という高い成功率を示す一方、記憶依存のRMBenchタスクでは12.5%と大幅に低下する。この差は、長期タスクにおける記憶と状態追跡の難しさを浮き彫りにしており、今後の課題として、記憶機構の強化や状態検証の改善が焦点になるだろう。 業界構造への含意として、VLAモデルの実用化には、単なる行動予測精度だけでなく、実行可能性の検証と回復機能が不可欠であることを示している。これは、ロボットのタスク実行における信頼性向上に寄与し、産業応用への道を開く可能性がある。ただし、RMBenchでの低い成功率は、現状のフレームワークが記憶依存タスクに十分対応できていないことを示しており、今後の研究でこの点をどう解決するかが注目される。
なぜ重要か
EmbodiedSkillsは、VLAモデルを長期タスクに適用するための実用的な枠組みを提供し、実行検証と回復機能を統合することで、ロボットの自律性と信頼性を高める。これは、産業用ロボットや家庭用ロボットなど、複雑なタスクを要求される分野での応用可能性を示唆する。