日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
タスク計画arXiv:2608.07905v1

GraphThink: グラフ強化LLM思考による長期的身体性タスク計画

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

シェア:XThreadsFacebookLINEはてブBluesky

LLMベースの身体性エージェントの計画における幻覚や長期タスクへの汎化不足を解決するため、タスクグラフとシーングラフを統合したフレームワークを提案。ALFREDベンチマークで最先端性能を達成した。

詳しい要約

1. どんなもの?

GraphThinkは、LLMベースのembodied agentのタスク計画を改善するためのフレームワークである。タスクグラフ(構造化された知識)とシーングラフ(環境記憶)を統合し、文脈プロンプトと反復的改良による計画の幻覚軽減、GRPOフレームワーク内での報酬設計による長期的計画能力の向上、シーングラフを用いたイベント駆動型再計画による閉ループ環境認識とエラー修正を実現する。ALFREDベンチマークで最先端の性能を達成し、特に高レベルプランナーは検証セットと未見の長期的タスクで主要なAPIベースLLMを上回る。

2. 先行研究と比べてどこがすごい?

従来のLLMベースのプランナーは、物理的幻覚、長期的タスクへの一般化の低さ、環境認識の欠如に悩まされていた。GraphThinkは、タスクグラフとシーングラフを導入することで、構造化知識と環境記憶を提供し、これらの問題を直接的に緩和する。特に、GRPOフレームワーク内でタスクグラフを報酬設計に活用する点が新規であり、APIベースLLMを上回る性能を達成している。

3. 技術・手法の肝は?

手法の核は3つのモジュールからなる。(1) タスクグラフによるLLM思考のガイド:文脈プロンプトと反復的改良により幻覚を軽減。(2) GRPOフレームワーク内でのタスクグラフを用いた報酬設計:LLMプランナーを訓練し、長期的計画能力と一般化を向上。(3) シーングラフによるイベント駆動型再計画:閉ループ環境認識とエラー修正を実現。

4. どうやって有効だと検証した?

ALFREDベンチマークで評価し、最先端の性能を達成。高レベルプランナーは検証セットと未見の長期的タスクで主要なAPIベースLLMを上回り、ゼロショットおよび少数ショット能力を示した。さらに、新規タスクと環境に対するout-of-distribution一般化の強さを追加評価で実証した。

5. 議論はある?

要旨からは、具体的な議論や限界は不明。ただし、提案手法がAPIベースLLMを上回る一方で、タスクグラフとシーングラフの構築コストや、実世界の複雑な環境への適用可能性などが潜在的な課題として考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連手法として、LLMベースのembodied planning、GRPO(Group Relative Policy Optimization)、ALFREDベンチマーク、シーングラフを用いた環境認識、タスクグラフを用いた計画手法などが挙げられる。具体的には、ALFREDベンチマークの元論文や、GRPOを導入した論文、LLMプランナーの幻覚軽減に関する研究が次に読むべき候補となる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

分類: cs.AI, cs.RO

原文アブストラクト

Embodied agents using LLM-based planners often struggle with physical hallucinations, poor generalization to long-horizon tasks, and lack of environmental awareness. We propose GraphThink, a novel framework that integrates a task graph to provide structured knowledge for robust planning and a scene graph to maintain environmental memory for event-driven replanning. Specifically, the task graph guides LLM thinking through contextual prompting and iterative refinement, effectively mitigating planning hallucinations. Furthermore, within the GRPO framework, the task graph offers delicate reward design to train the LLM planner, enhancing long-horizon planning capabilities and improving generalization. Finally, an event-driven replanning module, powered by the scene graph, enables closed-loop environment awareness and error correction. GraphThink achieves state-of-the-art performance on the ALFRED benchmark. In particular, our high-level planner surpasses leading API-based LLMs on both the validation set and held-out long-horizon tasks, underscoring its robust zero-shot and few-shot capabilities. Additional evaluations further demonstrate strong out-of-distribution generalization to novel tasks and environments.