何が起きたか

arxiv.orgに掲載された論文(2026年5月18日付)で、自動運転車(SDC)と12人の歩行者をMulti-Agent Proximal Policy Optimization(MAPPO)を用いて共訓練する手法が提案された。500エピソードの評価では、共訓練したSDCは目標到達率78%、衝突率14%を達成し、最良のルールベースのベースライン(35%/33%)を上回った。

詳細

論文では、歩行者の横断行動の不確実性を考慮するため、歩行者の移動はスクリプト化されたDijkstra経路探索に従い、RLポリシーが高レベルのgo/wait決定を制御する。Jaywalking(信号無視の横断)の確率は、エピソード開始時にサンプリングされSDCからは隠された歩行者ごとの特性に依存する。共訓練により、単一エージェントRLと比較して衝突が30%減少し、歩行者はSDCが高速で接近すると待つことを学習した。

Key Facts

論文はarxiv.orgで2026年5月18日に公開された。[1]
共訓練したSDCは500エピソードの評価で目標到達率78%、衝突率14%を達成した。[1]
最良のルールベースのベースラインは目標到達率35%、衝突率33%だった。[1]
共訓練により、単一エージェントRLと比較して衝突が30%減少した。[1]
Jaywalkingは横断イベントの13%を占めたが、衝突の62%を占めた。[1]

なぜ重要か

この研究は、自動運転車の安全性評価におけるシミュレーションの限界を克服する可能性を示す。歩行者の不確実性を考慮した共訓練は、より現実的なテストシナリオを提供し、自動運転システムの実用化に向けた信頼性向上に寄与するとみられる。