日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
自動運転arXiv:2608.13878

知識とデータの二重駆動による強化学習を用いた混在交通下の自動運転車制御

Knowledge-Data-Dual-Driven Reinforcement Learning for Autonomous Vehicle Control in Mixed Traffic

シェア:XThreadsFacebookLINEはてブBluesky

混在交通下での自動運転車の意思決定問題に対し、知識とデータの二重駆動による強化学習(KDDRL)を提案し、意図認識と安全な探索を実現した。

詳しい要約

1. どんなもの?

本論文は、混合交通環境における自動運転車(AV)の意思決定のための強化学習(RL)手法であるKnowledge-Data Dual-driven Reinforcement Learning (KDDRL)を提案している。KDDRLは、意図認識の欠如、非定常性による長尾の安全イベント、ハイブリッド行動空間の不安定さという3つの課題に対処する。具体的には、条件付き深層生成モデルによる意図認識型の将来軌道予測、知識とデータの二重駆動による安全探索、連続的車追従と離散的车線変更の非同期マルチタイムスケール最適化を実現する。

2. 先行研究と比べてどこがすごい?

従来の物理ベースの事前知識をRLに組み込む手法は、潜在的な相互作用意図や多様な運転者行動を捉えられず、事前推論能力が限定的だった。また、ハイブリッド行動空間を扱う既存の統一RL訓練は、連続と離散の時間スケールの違いにより不安定になる問題があった。KDDRLは、意図認識型の予測状態を導入し、知識とデータの二重駆動パラダイムで物理的制約とデータ駆動の洞察を融合することで、これらの限界を克服している。さらに、結合モジュールにより共通埋め込み表現を生成し、非同期のマルチタイムスケール最適化を可能にしている点が新しい。

3. 技術・手法の肝は?

手法の核心は3つの要素からなる。第一に、条件付き深層生成モデルを用いて意図認識型の将来軌道を合成し、受動的知覚を能動的な予測状態に変換する。第二に、知識とデータの二重駆動パラダイムを予測状態に適用し、確率的データ駆動の洞察と物理的制約を融合して、安全クリティカルなシナリオでの安全な探索を導く。第三に、結合モジュールが意図認識型軌道と物理的制約を圧縮してコンパクトな共有埋め込みを生成し、この統一表現により連続的な車追従と離散的な車線変更の非同期マルチタイムスケール最適化を相互情報を保ちながら実現する。

4. どうやって有効だと検証した?

データセット較正されたシミュレーションを用いて評価を行った。その結果、KDDRLが意図の不確実性を効果的に処理し、訓練の収束を加速し、安全性、効率性、快適性の点で従来のベースライン手法を上回ることを示した。具体的な数値や比較対象の詳細は要旨からは不明。

5. 議論はある?

要旨からは、提案手法の限界や議論点は明示されていない。ただし、シミュレーション評価のみであり、実世界での検証が未実施である可能性が考えられる。また、知識とデータの二重駆動のバランスや、生成モデルの品質が性能に与える影響などが議論の余地があるが、要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、強化学習による自動運転制御、ハイブリッド行動空間、深層生成モデルによる軌道予測、知識とデータの融合手法などが関連する。次に読むべき論文としては、自動運転のための強化学習のサーベイ、ハイブリッド行動空間を扱うRL手法、条件付き生成モデルによる軌道予測の研究などが挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jie Fang, Wei Zheng, Mengyun Xu, Eui-Jin Kim

分類: cs.RO, eess.SY

原文アブストラクト

In mixed traffic, decision-making for autonomous vehicles (AVs) confronts three interrelated challenges. First, physics-based priors incorporated into reinforcement learning (RL) models fail to capture latent interactive vehicle intentions and diverse driver behaviors, limiting the proactive reasoning capabilities. Second, abrupt maneuvers by surrounding vehicles cause non-stationarity, leaving long-tail safety events under-explored. Third, hybrid action spaces destabilize unified RL training due to the different temporal scales of continuous car-following and discrete lane-changing maneuvers. To address these issues, we propose Knowledge-Data Dual-driven Reinforcement Learning (KDDRL). First, a conditional deep generative model synthesizes intention-aware future trajectories, converting passive perception into proactive predictive states. Second, a knowledge-data dual-driven paradigm operates on these predictive states, fusing probabilistic data-driven insights with physical constraints to guide safe exploration through safety-critical scenarios. Third, a coupling module compresses both intention-aware trajectories and physical constraints into compact shared embeddings. This unified representation enables asynchronous multi-timescale optimization of continuous car-following and discrete lane-changing while preserving mutual information. Evaluations on dataset-calibrated simulations demonstrate that KDDRL effectively handles intention uncertainty, accelerates training convergence, and outperforms conventional baseline methods in terms of safety, efficiency, and comfort.

関連論文