何が起きたか
arXivに2026年8月17日付で公開された論文(識別子: 2608.17146v1)において、研究チームはVision-Language Model(VLM)を用いたフレームワーク「PDDL-ART」を提案した。PDDL-ARTは、単一の専門家デモ、自然言語のタスク記述、利用可能な高レベルアクション名のライブラリから、タスク固有のPDDLドメインと問題記述を自律的に生成する。同フレームワークは、ドメインテンプレート、アクションシグネチャ、ファインチューニングを一切必要としない。
詳細
PDDL-ARTは、生成された記述が構文的に有効であるだけでなく、デモされたタスクと意味的に整合することを保証するため、構文・意味・実行レベルの3段階で動作する多段階補正パイプラインを導入している。実行ガイド付き補正の主要な構成要素は、記号的述語のグラウンディングである。視覚的観察のみに依存するのではなく、PDDL-ARTは現代のVLMのツール使用能力を活用し、画像だけからは直接判別できない関係述語を評価するために幾何学的・時間的推論を取り入れる。モデルは、これらのツールをいつ呼び出すか、その出力をどう解釈するかを自律的に決定する。 評価は、エンジン整備と家庭内領域の困難な操作タスクで実施され、記憶、抽象述語推論、初期状態と視覚的に区別できない目標状態を必要とするタスクが含まれる。PDDL-ARTは平均成功率93.3%を達成し、ベースラインのVLMベースのプランナーの78.3%を上回った。
Key Facts
| PDDL-ARTは、単一の専門家デモ、自然言語タスク記述、高レベルアクション名のライブラリからPDDLドメインと問題記述を自動生成する(ソース0) | [1] |
| PDDL-ARTはドメインテンプレート、アクションシグネチャ、ファインチューニングを必要としない(ソース0) | [1] |
| PDDL-ARTは構文・意味・実行レベルの多段階補正パイプラインを導入している(ソース0) | [1] |
| 実行ガイド付き補正の主要構成要素は記号的述語のグラウンディングである(ソース0) | [1] |
| PDDL-ARTはVLMのツール使用能力を活用し、幾何学的・時間的推論で関係述語を評価する(ソース0) | [1] |
| モデルはツールをいつ呼び出すか、出力をどう解釈するかを自律的に決定する(ソース0) | [1] |
| 評価はエンジン整備と家庭内領域の操作タスクで実施された(ソース0) | [1] |
| タスクには記憶、抽象述語推論、初期状態と視覚的に区別できない目標状態が含まれる(ソース0) | [1] |
| PDDL-ARTの平均成功率は93.3%、ベースラインのVLMベースプランナーは78.3%だった(ソース0) | [1] |
なぜ重要か
PDDL-ARTは、長期的ロボット操作におけるPDDLドメイン構築のボトルネックを解消する可能性がある。専門家の知識を必要とせず、単一のデモから自律的に記述を生成できるため、ロボットのタスク計画の自動化と汎用性向上に寄与すると考えられる。