何が起きたか

arXivに2026年8月17日付で公開された論文「Neurosymbolic Embodied Agents」において、研究チームは、長期的な家庭内タスクをタスク指向の視覚探索と制約付きシンボリック計画に分解するニューロシンボリックエージェントを発表した。このエージェントは、VirtualHomeとALFWorldの両環境で、オープンな4B-27Bモデルが90%超の成功率を達成したと報告している。

詳細

このエージェントは2つのフェーズで動作する。第1フェーズでは、視覚言語モデルと探索ハーネスが、自己中心視点の観察と接地された相互作用から目標関連の述語とインスタンスの束縛を獲得し、シンボリックな初期状態を生成する。第2フェーズでは、PDDL遷移モデルが、適用可能なアクションを拡張するトークンへのデコードを制限し、モンテカルロ木探索がドメイン非依存の計画ヒューリスティックを用いて実行可能な継続を評価する。 研究チームは、制約と探索は補完的であり、交換可能ではないと述べている。ALFWorldでは、どちらか一方だけではタスクの3分の1未満しか解決できないのに対し、組み合わせることで95%超を解決した。また、この手法は、拡張思考よりも数倍少ないトークン生成で済み、直接相互作用よりもはるかに少ないモデル可視画像で済むとしている。残存する失敗は、計画生成ではなく状態獲得に局在しており、特別なトレーニングは不要であると報告されている。

Key Facts

論文はarXivで2026年8月17日に公開された(ソース0)[1]
エージェントはタスク指向の視覚探索と制約付きシンボリック計画を組み合わせる(ソース0)[1]
第1フェーズで視覚言語モデルと探索ハーネスがシンボリック初期状態を生成する(ソース0)[1]
第2フェーズでPDDL遷移モデルが適用可能なアクションのトークンにデコードを制限する(ソース0)[1]
モンテカルロ木探索がドメイン非依存の計画ヒューリスティックを使用する(ソース0)[1]
VirtualHomeとALFWorldでオープンな4B-27Bモデルが90%超の成功率を達成(ソース0)[1]
ALFWorldでは制約と探索の組み合わせで95%超のタスクを解決(ソース0)[1]
制約または探索のみではALFWorldでタスクの3分の1未満しか解決できない(ソース0)[1]
この手法は拡張思考より数倍少ないトークン生成で済む(ソース0)[1]
残存する失敗は状態獲得に局在し、特別なトレーニングは不要(ソース0)[1]

なぜ重要か

この研究は、言語モデルと視覚言語モデルが生成する計画の実行可能性を保証するための新しいアプローチを示している。制約付きシンボリック計画と探索の組み合わせが、実環境での成功率を大幅に向上させることを実証しており、具現化エージェントの信頼性向上に寄与する可能性がある。