日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/プランニングarXiv:2608.16794v1

ニューロシンボリック具現化エージェント

Neurosymbolic Embodied Agents

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語モデルとシンボリックプランニングを組み合わせ、家庭内の長期的タスクを実行可能な計画として生成するエージェントを提案。探索と制約付き計画により、実行可能性を保証しつつ高い成功率を達成。

詳しい要約

1. どんなもの?

本論文は、長期的な家事タスクを実行するニューロシンボリックエージェントを提案する。このエージェントは、視覚言語モデルと記号的プランニングを組み合わせ、タスク指向の視覚探索と制約付き記号プランニングの2段階で構成される。第1段階では、視覚言語モデルと探索ハーネスが、自己中心視点の観察と接地されたインタラクションから、目標関連の述語とインスタンスの束縛を獲得し、記号的初期状態を生成する。第2段階では、PDDL遷移モデルが、適用可能なアクションを拡張するトークンへのデコーディングを制限し、モンテカルロ木探索がドメイン非依存のプランニングヒューリスティックを用いて実行可能な継続を評価する。生成されたプランは遷移モデル下で実行可能であり、環境への転移は視覚的接地の正確さに依存する。

2. 先行研究と比べてどこがすごい?

従来の言語・視覚言語モデルはもっともらしいプランを生成するが、実行可能性を保証しない。本手法は、記号的プランニングの制約と探索を組み合わせることで、プランの実行可能性を構造的に保証する点が新しい。また、大規模モデル(4B-27B)を用いて、VirtualHomeとALFWorldで90%以上の成功率を達成し、最小のエージェントでも27Bの直接視覚ポリシーを大幅に上回る。さらに、制約と探索は相補的であり、単独ではALFWorldのタスクの3分の1未満しか解けないが、組み合わせると95%以上を解くことを示した。

3. 技術・手法の肝は?

手法の核心は、2段階のパイプラインと制約付きデコーディングにある。第1段階では、視覚言語モデルと探索ハーネスを用いて、環境から述語とインスタンスの束縛を抽出し、記号的初期状態を構築する。第2段階では、PDDL遷移モデルが、現在の状態で適用可能なアクションに対応するトークンのみを生成するようにデコーディングを制限し、モンテカルロ木探索が実行可能なプランを探索する。これにより、プランは遷移モデル下で実行可能であることが保証される。

4. どうやって有効だと検証した?

VirtualHomeとALFWorldの2つの環境で評価した。オープンな4B-27Bモデルを用いて、両環境で90%以上の成功率を達成した。最小のエージェントでも、27Bの直接視覚ポリシーを大幅に上回る性能を示した。また、制約と探索の組み合わせが重要であることを示すため、それぞれ単独の場合と比較し、ALFWorldでは単独では3分の1未満の成功率だが、組み合わせると95%以上になることを確認した。さらに、生成トークン数とモデルが見る画像数が、拡張思考や直接インタラクションよりも少ないことを示した。

5. 議論はある?

残存する失敗は、プラン生成ではなく状態獲得に起因することが示された。つまり、視覚的接地や述語抽出の誤りが主な失敗原因であり、プランニング自体は堅牢である。また、制約と探索は相補的であり、どちらか一方だけでは不十分であることが議論されている。しかし、要旨からは、提案手法の限界や他の環境への一般化についての詳細な議論は不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、VirtualHomeとALFWorldのベンチマーク、PDDLプランニング、モンテカルロ木探索、視覚言語モデルを用いたプランニング手法が挙げられる。具体的には、VirtualHomeの元論文、ALFWorldの元論文、PDDLの標準的なプランナー、MCTSを用いたプランニング手法、および視覚言語モデルによるプランニングの研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

分類: cs.RO, cs.AI, cs.CL

原文アブストラクト

Language and vision-language models generate plausible embodied plans but do not guarantee executability, as their outputs can violate environment dynamics or act on incorrectly grounded entities. We present a neurosymbolic agent that factors long-horizon household tasks into task-directed visual exploration and constrained symbolic planning. In the first phase, a vision-language model and exploration harness acquire goal-relevant predicates and instance bindings from egocentric observations and grounded interactions, producing a symbolic initial state. In the second, a PDDL transition model restricts decoding to tokens that extend applicable actions. Monte Carlo tree search then evaluates executable continuations using a domain-independent planning heuristic. The resulting plans are executable by construction under the transition model, with transfer to the environment conditioned on correct visual grounding. On VirtualHome and ALFWorld, open 4B-27B models exceed 90% success in both environments, and our smallest agent substantially outperforms a 27B direct visual policy in each. Constraints and search prove complementary rather than interchangeable: in ALFWorld either alone solves under a third of tasks, whereas their combination solves over 95%. The method also uses several times fewer generated tokens than extended thinking and far fewer model-visible images than direct interaction, and residual failures localize to state acquisition rather than plan generation without any specialized training.