日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
自動運転arXiv:2609.03225v1

マルチスタイルのエンドツーエンド運転のための長期的整合性と相互作用を考慮したワールドモデル

Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving

シェア:XThreadsFacebookLINEはてブBluesky

ワールドモデルベースの強化学習を用いた自動運転フレームワークStyleDriveを提案し、長期的整合性の確保、相互作用状態の分離、多様な運転スタイルの最適化を実現した。

詳しい要約

1. どんなもの?

StyleDriveは、世界モデルベースの強化学習を用いたエンドツーエンド自動運転のためのフレームワークである。長期的な想像ロールアウトの時間的一貫性の欠如、エゴと環境の相互作用のモデル化不足、多様な運転スタイルへの適応性の限界という既存の世界モデルの3つの課題に対処する。具体的には、時間的一貫性の正則化、インタラクティブな交通状態の明示的な分離、多スタイルのポリシー最適化を統一的な学習パラダイムで実現する。

2. 先行研究と比べてどこがすごい?

先行研究の世界モデルベースの手法と比較して、StyleDriveは長期的な想像ロールアウトにおける時間的不整合性を軽減し、エゴ関連と非関連の状態を分離することで解釈可能性と意思決定効率を向上させ、Group Relative Policy Optimization (GRPO)により再学習なしで多様な運転スタイルをサポートする点が優れている。Bench2Driveベンチマークで、従来の最良の世界モデルベース手法を運転スコアで+17.08、成功率で+16.58上回る。

3. 技術・手法の肝は?

手法の核心は3つの要素からなる。(1) 時間的一貫性の正則化:ゲート付きクロスアテンションを用いて過去の潜在状態を統合し、長期的な想像ロールアウトの安定化と誤差蓄積の緩和を図る。(2) 明示的な状態分離モジュール:エゴ関連とエゴ非関連のインタラクティブな状態を分離し、複雑な交通シナリオでの解釈可能で効率的な意思決定を可能にする。(3) 多スタイル運転行動の実現:Group Relative Policy Optimization (GRPO)を導入し、ステップごとの報酬最適化を軌跡ごとの相対的アドバンテージに置き換えることで、報酬の分散を減らし、再学習なしで多様な運転スタイルをサポートする。

4. どうやって有効だと検証した?

有効性の検証は、Bench2Driveクローズドループ運転ベンチマークで行われ、運転スコア88.44(従来の最良の世界モデルベース手法より+17.08)、成功率66.82(+16.58)を達成した。さらに、実機の自動誘導車両プラットフォームに展開し、動的な運転シナリオでのsim-to-real転送能力を示した。

5. 議論はある?

要旨からは、StyleDriveの限界や潜在的な欠点についての議論は不明である。ただし、実機展開は自動誘導車両プラットフォームに限定されており、一般の自動運転車両への適用可能性や、より複雑な都市環境での性能については言及されていない。また、多様な運転スタイルの定義や、GRPOの理論的保証についての詳細は要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、世界モデルベースの強化学習フレームワーク(例:Dreamerシリーズ)や、Bench2Driveベンチマークの提案論文が挙げられる。また、Group Relative Policy Optimization (GRPO)は、大規模言語モデルの強化学習で用いられる手法であり、その元となったPPOや、関連する報酬モデリングの研究も参考になる。具体的な論文タイトルは要旨に記載がないため、これらの一般名で示す。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu

分類: cs.RO

原文アブストラクト

End-to-end autonomous driving has increasingly adopted world model-based reinforcement learning frameworks to improve learning efficiency through \textit{imagined rollouts}. However, existing world models suffer from three key limitations: temporal inconsistency in long-horizon imagined rollouts, inadequate modeling of ego-environment interactions, and limited adaptability to diverse driving styles. To address these challenges, we propose \textit{StyleDrive}, a world-model-based learning framework that jointly enforces long-horizon consistency, explicitly disentangles interactive traffic states, and supports multi-style policy optimization within a unified learning paradigm. First, we introduce a temporal consistency regularization that integrates historical latent states through gated cross-attention, stabilizing long-horizon imagined rollouts and mitigating error accumulation. Second, we design an explicit state disentanglement module that separates ego-relevant from ego-irrelevant interactive states, enabling more interpretable and efficient decision-making in complex traffic scenarios. Third, we enable multi-style driving behaviors through Group Relative Policy Optimization, which replaces per-step reward optimization with trajectory-wise relative advantages, reducing reward variance and supporting diverse driving styles without retraining. We evaluate StyleDrive on the Bench2Drive closed-loop driving benchmark, achieving a driving score of 88.44 (+17.08 over the previous best world model-based method) and a success rate of 66.82 (+16.58). Furthermore, we deploy StyleDrive on a real automated guided vehicle platform and demonstrate promising sim-to-real transfer capability in dynamic driving scenarios.

関連論文