日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
操作計画arXiv:2608.17146v1

PDDL-ART: デモンストレーションからの自律的シンボリック抽象化による長期的ロボット操作のための視覚言語モデル

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

シェア:XThreadsFacebookLINEはてブBluesky

本論文は、単一の専門家デモと自然言語タスク記述からPDDLドメインと問題記述を自動生成するVLMベースのフレームワークPDDL-ARTを提案する。構文・意味・実行レベルの多段階補正パイプラインと、幾何・時間推論のためのツール使用を導入し、長期的操作タスクで有効性を示した。

詳しい要約

1. どんなもの?

PDDL-ARTは、単一の専門家デモンストレーション、自然言語のタスク記述、利用可能な高レベルアクション名のライブラリから、タスク固有のPDDLドメインと問題記述を自律的に生成するフレームワークである。Vision-Language Model (VLM)を基盤とし、ドメインテンプレートやアクションシグネチャ、ファインチューニングを必要としない。生成された記述が構文的に有効で、デモンストレーションされたタスクと意味的に整合することを保証するため、構文・意味・実行レベルの多段階修正パイプラインを導入する。特に、実行ガイド付き修正の鍵となるシンボリック述語グラウンディングでは、視覚観察のみに頼らず、現代のVLMのツール使用能力を活用して幾何的・時間的推論を行い、画像だけでは直接判別できない関係述語を評価する。モデルはツールをいつ呼び出すか、その出力をどう解釈するかを自律的に決定する。

2. 先行研究と比べてどこがすごい?

従来のPDDLドメイン構築は専門知識を要する手作業がボトルネックであり、既存の自動生成手法はドメインテンプレートやアクションシグネチャ、ファインチューニングを必要とすることが多い。PDDL-ARTはこれらを一切不要とし、単一のデモと自然言語記述から直接PDDLを生成する点で革新的である。また、VLMベースのプランナーと比較して、実行ガイド付き修正とシンボリック述語グラウンディングにより、視覚的に区別できない目標状態や抽象的な述語推論を必要とするタスクで高い成功率を達成している。

3. 技術・手法の肝は?

PDDL-ARTの手法の肝は、多段階修正パイプラインとシンボリック述語グラウンディングにある。まず、VLMを用いてデモとタスク記述から初期のPDDLドメインと問題を生成する。次に、構文レベルでPDDLの構文チェック、意味レベルで自然言語との整合性チェック、実行レベルでプランを実際に実行して検証する。実行ガイド付き修正では、視覚観察だけでは不十分な関係述語(例:物体の内部状態や時間的関係)を評価するために、VLMのツール使用能力を活用し、幾何的・時間的推論を行う。モデルはツールの呼び出しタイミングと出力解釈を自律的に決定する。

4. どうやって有効だと検証した?

エンジンメンテナンスと家庭用ドメインの挑戦的な操作タスクで評価した。タスクには、記憶を必要とするもの、抽象的な述語推論を必要とするもの、初期状態と視覚的に区別できない目標状態を持つものが含まれる。PDDL-ARTは平均成功率93.3%を達成し、ベースラインのVLMベースプランナーの78.3%を上回った。

5. 議論はある?

要旨からは、PDDL-ARTの限界や議論についての詳細は不明である。ただし、VLMのツール使用に依存するため、ツールの精度やモデルの判断が結果に影響する可能性が考えられる。また、単一のデモからの生成であるため、デモの質や多様性が性能に影響する可能性がある。さらに、評価は特定のドメインに限定されており、一般化についてはさらなる検証が必要かもしれない。

6. 次に読むべき論文は?

要旨で参照されているベースラインのVLMベースプランナーに関する論文が挙げられる。また、関連手法として、PDDLドメイン自動生成の既存研究や、VLMを用いたロボット操作プランニングの研究が考えられる。具体的には、PDDLドメイン生成のためのLLMベースの手法や、VLMを用いたタスクプランニングの研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Disha Kamale, Dmitry Berenson

分類: cs.RO

原文アブストラクト

Symbolic planning with PDDL offers a principled framework for long-horizon robot manipulation, but constructing accurate PDDL domain and problem descriptions remains a significant bottleneck, typically requiring substantial domain expertise. We present a Vision-Language Model (VLM)-based approach called PDDL-ART, a framework that autonomously generates task-specific PDDL domain and problem descriptions from a single expert demonstration, a natural language task description, and a library of available high-level action names. PDDL-ART does not require any domain templates, action signatures, or fine-tuning. To ensure the generated descriptions are not only syntactically valid but semantically aligned with the demonstrated task, PDDL-ART introduces a multi-stage correction pipeline operating at syntactic, semantic, and execution levels. A key component of execution-guided correction is symbolic predicate grounding. Instead of relying solely on visual observations, PDDL-ART leverages the tool-use capabilities of modern VLMs to incorporate geometric and temporal reasoning for evaluating relational predicates that are not directly discernible from images alone. Critically, the model autonomously determines when to invoke these tools and how to interpret their outputs. We evaluate PDDL-ART on challenging manipulation tasks in engine maintenance and household domains, including tasks that require memory, abstract predicate inference, and goal states that are visually indistinguishable from the initial state. PDDL-ART achieves an average success rate of 93.3%, compared to 78.3% for a baseline VLM-based planner.