日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
タスク・動作計画arXiv:2608.20084v1

視覚言語モデルを用いた証拠ゲート型タスク・動作計画

Evidence-Gated Task and Motion Planning with Vision-Language Models

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語モデルとタスク・動作計画を組み合わせ、不確かな環境で視覚的証拠を取得してから計画を進めるか判断するフレームワークを提案した。調理タスクで物体の有無が曖昧な場合に、計画前に物体を発見して成功率を向上させ、欠落物体の操作を減らした。

詳しい要約

1. どんなもの?

本論文は、自然言語指示から長期的な操作タスクを実行するロボットにおいて、部分観測環境下で目標関連オブジェクトの存在が不確実な場合に、Vision-Language Models (VLMs) と Task and Motion Planning (TAMP) を組み合わせる際の問題を扱う。VLMsの事前知識に依存したサブゴールが観測的裏付けなしに生成され、実行失敗や意図しない結果を招くことを指摘し、これを解決するフレームワーク Evidence Acquisition and Feasibility Gating (EAFG) を提案する。EAFGは、VLMが生成した探索的サブゴールとTAMPベースの実行を通じて視覚的証拠を獲得し、Feasibility Gateを適用して、タスク計画を続行するか、さらなる証拠を獲得するか、停止するかを決定する。

2. 先行研究と比べてどこがすごい?

先行研究では、VLMsとTAMPを組み合わせる際、VLMの事前知識に基づくサブゴールがそのまま計画に組み込まれ、部分観測性による不確実性が考慮されていなかった。EAFGは、観測的証拠の獲得を明示的に組み込み、Feasibility Gateによって証拠が不十分な場合に計画を進めず、探索や停止を選択する点が新しい。これにより、曖昧なオブジェクト使用を伴う調理タスクでのレシピ完了率向上や、存在しないオブジェクトを要求する指示での適切な停止判断を実現している。

3. 技術・手法の肝は?

EAFGの核心は、VLMを用いて探索的サブゴールを生成し、それをTAMPで実行して視覚的証拠を獲得するループと、Feasibility Gateによる意思決定である。具体的には、VLMが現在のシーンと指示に基づいて次のアクション(探索または操作)を提案し、TAMPがその実行可能性を幾何学的に検証する。実行後、新しい観測が得られ、Feasibility Gateがタスク計画の続行、追加証拠の獲得、または停止を決定する。このゲートは、目標オブジェクトの存在確率やタスク達成可能性を評価する。

4. どうやって有効だと検証した?

実験は、調理タスクにおいて、オブジェクトの使用が曖昧な場合と、存在しないオブジェクトを要求する指示の場合で行われた。曖昧な場合では、EAFGがタスク関連オブジェクトを計画前に発見することでレシピ完了率を向上させた。存在しないオブジェクトの場合では、EAFGが適切な停止判断を促進し、そのオブジェクトの操作試行回数を削減した。具体的な数値や比較ベースラインは要旨からは不明。

5. 議論はある?

要旨からは、EAFGの限界や議論についての詳細は不明。ただし、VLMの事前知識に依存しすぎず、観測的証拠を重視するアプローチは、部分観測環境でのロバスト性を高める一方で、探索コストや停止判断の正確性に関するトレードオフが考えられる。また、Feasibility Gateの設計や、VLMの探索サブゴール生成の品質が性能に影響する可能性がある。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連する分野として、Vision-Language Models (VLMs) と Task and Motion Planning (TAMP) を組み合わせた既存研究(例: LLM-TAMP 統合)や、部分観測下でのロボット計画(例: POMDP-based planning)が挙げられる。具体的には、VLMを用いたタスク計画の研究や、TAMPの不確実性を扱う研究を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

分類: cs.RO, cs.AI

原文アブストラクト

Robots executing long-horizon manipulation tasks from natural-language instructions must reason about both semantic task structure and geometric feasibility. However, under partial observability, the availability of goal-relevant objects may be uncertain. In such cases, approaches that combine Vision-Language Models (VLMs) with Task and Motion Planning (TAMP) may generate subgoals that rely on the VLM's prior knowledge without observational support, leading to execution failures or unintended outcomes. We propose Evidence Acquisition and Feasibility Gating (EAFG), a framework that acquires visual evidence through VLM-generated exploratory subgoals and TAMP-based execution. EAFG then applies a feasibility gate to decide whether to proceed with task planning, acquire further evidence, or halt. Our experiments show that, in cooking tasks with ambiguous object use, EAFG improves recipe completion by discovering task-relevant objects before planning. For instructions requiring an absent object, EAFG promotes appropriate halt decisions and reduces repeated attempts to manipulate that object.