日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
自動運転/軌道計画arXiv:2608.18254

GAPL: LLMベース軌道計画のための接地された行動効果ポリシー学習

GAPL: Grounded Action-effect Policy Learning for LLM-Based Trajectory Planning

シェア:XThreadsFacebookLINEはてブBluesky

自動運転の軌道計画において、LLMの推論能力とシミュレーションによる環境ダイナミクスの接地を組み合わせ、PPOでポリシーを最適化する閉ループフレームワークGAPLを提案した。

詳しい要約

1. どんなもの?

GAPLは、自動運転の軌道計画のための統合フレームワークであり、LLMベースの効果推定、シミュレーションによる効果の接地、およびポリシー最適化を閉ループシステムに統合する。3つのモジュール(LLMベースのEffect Evaluator、Simulation-based Effect Grounder、Effect-Aware Decision Maker)から構成される。

2. 先行研究と比べてどこがすごい?

従来のLLMベースの軌道計画は、幻覚的な推論、環境ダイナミクスへの接地不足、制御における数値精度の限界があった。GAPLは、シミュレーションによる効果の接地とPPOベースのポリシー学習を組み合わせることで、これらの問題に対処し、より正確で信頼性の高い計画を実現する。

3. 技術・手法の肝は?

手法の核心は、LLMによる効果推定をシミュレーションのロールアウトから得られるダイナミクス一貫性のある効果と照合することにある。具体的には、Effect Evaluatorが多次元の行動効果を構造化して推定し、Simulation-based Effect Grounderがシミュレーションから効果を予測し、Effect-Aware Decision Makerが蒸留器を介してLLMの効果推定をシミュレーションに接地し、PPOベースのポリシー学習を導く。

4. どうやって有効だと検証した?

4つのHighway-envシナリオで実験を行い、ベースラインと比較して、衝突率、平均変位誤差(ADE)、最終変位誤差(FDE)をそれぞれ平均0.76、0.86、2.00削減し、平均報酬を1.44向上させた。

5. 議論はある?

要旨からは、GAPLの限界や議論点は不明である。ただし、LLMの効果推定をシミュレーションで接地するアプローチは、実世界の複雑なダイナミクスへの適用可能性や、シミュレーションと実環境のギャップ(sim-to-real gap)に関する議論が考えられるが、要旨には記載がない。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、LLMを用いた軌道計画や強化学習(PPO)に関する論文が考えられる。具体的には、Highway-env環境でのベースライン手法や、LLMと強化学習を組み合わせた研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhihong Cui, Hengyu Liu, Zhangkai Wu, Yushuai Li, Tianyi Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

分類: cs.RO

原文アブストラクト

Trajectory planning for autonomous driving requires both high-level reasoning and precise low-level control. Large Language Models (LLMs) offer semantic-rich planning capabilities, however, their application is limited by hallucinated reasoning, poor grounding in environment dynamics, and limited numerical precision in control. We propose GAPL (Grounded Action-effect Policy Learning), a unified framework that integrates LLM-based effect estimation, simulation-based effect grounding, and policy optimization into a closed-loop system. GAPL consists of three modules: (1) an LLM-based Effect Evaluator for structured multi-dimensional action-effect estimation; (2) a Simulation-based Effect Grounder that predicts dynamics-consistent effects from simulator rollouts; and (3) an Effect-Aware Decision Maker that grounds LLM effect estimates against simulation via a distiller to guide Proximal Policy Optimization (PPO)-based policy learning. Experiments on four Highway-env scenarios demonstrate that GAPL consistently outperforms baselines, achieving average reductions of {0.76, 0.86, 2.00} in collision rate, average displacement error (ADE), and final displacement error (FDE), and an average reward gain of 1.44.

関連論文