何が起きたか
研究チームは2025年10月16日、arXivに論文「RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks」を公開した。この手法は、階層型VLAフレームワークにおけるVLMベースのプランナーがタスクを分解する際に、デモンストレーションを自動でサブタスクへ分割する。シミュレーションと実世界のタスクで、既存のサブタスク分解手法を上回る性能を達成したと報告している。
詳細
RDDは、低レベル視覚運動ポリシーの訓練データの視覚特徴と、分解されたサブタスク区間の視覚特徴を整合させることで、デモンストレーションを自動的にサブタスクへ分解する。従来の手法では、人間の注釈やヒューリスティックなルールによる分割が必要であり、ヒューリスティックな分割は視覚運動ポリシーの訓練データから大きく逸脱し、タスク性能を低下させる問題があった。RDDはこの問題を解決する。論文では、シミュレーションと実世界の両方で最先端のサブタスク分解手法を上回る性能を示し、多様な設定での堅牢性を実証している。コードと追加結果はrdd-neurips.github.ioで公開されている。
Key Facts
| 研究チームは2025年10月16日にarXivで論文「RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks」を公開した。 | [1] |
| RDDは、低レベル視覚運動ポリシーの訓練データの視覚特徴と、分解されたサブタスク区間の視覚特徴を整合させることで、デモンストレーションを自動的にサブタスクへ分解する。 | [1] |
| 従来のヒューリスティックなサブタスク分割は、視覚運動ポリシーの訓練データから逸脱し、タスク性能を低下させる問題があった。 | [1] |
| RDDはシミュレーションと実世界のタスクで、最先端のサブタスク分解手法を上回る性能を示した。 | [1] |
| コードと追加結果はrdd-neurips.github.ioで公開されている。 | [1] |
なぜ重要か
この研究は、ロボットの長期的な操作タスクにおけるプランナーとポリシーの整合性を自動化する手法を提案しており、人手による注釈への依存を減らす可能性がある。VLAモデルの実用化に向けて、タスク分解の自動化は重要な進展であり、今後のロボット学習の効率化に影響を与えるとみられる。