何が起きたか
arxiv.orgは2026-09-08、PlannerForgeというLLMエージェント枠組みを公開した。自動運転のシナリオベーステストについて、Scenario GenerationからADS Assessmentまでを一体で扱い、さらにADS EnhancementとADS Benchmarkingの2段階を追加する設計である。著者らは10種類の既製LLMを、Generation、Selection、Modification、Module Routing、Planner Testing、Enhancementの各課題で5つのプロンプト条件の下で評価した。 結果として、各課題の最良スコアは0.88〜1.00だった。オープンソースの20〜35Bバックエンドは多くの課題で商用APIに並び、Qwen3.6:35Bは5課題のうち3課題で商用APIと同等だったとしている。
詳細
PlannerForgeは、シナリオ生成、検索、修正、ADS実行、結果分析が分断されがちな既存のシナリオベーステストを、単一のLLMエージェント枠組みにまとめることを狙う。論文は、Scenario GenerationからADS Assessmentまでの既存段階に加え、ADS EnhancementとADS Benchmarkingを組み込む構成を示している。 評価では、モジュールを終端まで連結した場合、seed queriesの保持率は商用モデルで83%、オープンソースモデルで78%だった。自然言語生成ではScenario Factory 2.0の193/200 executableに対し144/200 executableを上回る形で比較され、Rank 1選択ではBM25の92.0%に対して67.5%を比較対象としている。また、物理的に妥当な編集ではFrom-Words-to-Collisionsの31%に対し94%以上を示し、N=400ではcost-tuningによりplanner successが50.4%から70.2%へ、collisionsが19.0%から8.4%へ変化したと報告している。
Key Facts
| PlannerForgeは、自動運転のシナリオベーステストをScenario GenerationからADS Assessmentまで扱うLLMエージェント枠組みである。 | [1] |
| PlannerForgeは、ADS EnhancementとADS Benchmarkingの2段階を追加する。 | [1] |
| 著者らは10種類の既製LLMを、5つのプロンプト条件の下で評価した。 | [1] |
| 最良スコアはGeneration、Selection、Modification、Module Routing、Planner Testing、Enhancementで0.88〜1.00だった。 | [1] |
| オープンソースの20〜35Bバックエンドは多くの課題で商用APIに匹敵し、Qwen3.6:35Bは5課題のうち3課題で商用APIと同等だった。 | [1] |
本紙の見方
PlannerForgeの新規性は、単一の課題性能ではなく、シナリオ生成から評価までの検証パイプライン全体をLLMエージェントでつなごうとした点にある。既存のシナリオベーステストは、生成、検索、修正、実行、分析が個別ツールに分かれていたが、今回の枠組みはそこにADS EnhancementとADS Benchmarkingを追加し、検証と改善を同じ設計空間で扱う。これは、LLMを自動運転の“部品”として使う段階から、テスト運用の制御層として使う段階へ進める試みと読める。 数値面では、最良スコアが0.88〜1.00に達した一方、終端連結時のseed queries保持率は商用83%、オープン78%にとどまった。つまり、個々のモジュールでは高い成績でも、工程をつなぐと情報保持や制御の難しさが残る。ここからは、評価設計そのものが論点になる。自然言語生成でScenario Factory 2.0の193/200 executableを上回る一方、Rank 1選択ではBM25と比較されており、PlannerForgeは生成系・検索系・編集系をまたぐ統合枠組みとして位置づく。ただし、どの工程が全体の律速になっているかは、単一指標では見えない。 本紙の見方では、この論文の焦点は「LLMが自動運転をどこまで理解できるか」ではなく、「シナリオテストの工程分割をどこまでLLMで再編できるか」にある。Qwen3.6:35Bが商用APIと3/5課題で並んだ点は、モデルの出自よりも、十分なスケールのオープンソース基盤が検証実務に使える可能性を示す。ただし、論文内の評価はシミュレーション中心の比較であり、実運用で必要な再現性、失敗例の偏り、評価データの汎化範囲までは読み切れない。次に確認すべきなのは、各モジュールの入出力制約、Benchmarksの構成、そしてcost-tuningがどの条件で50.4%から70.2%へ改善し、どの条件でcollision 8.4%まで下げたのかという適用範囲である。
なぜ重要か
自動運転の検証では、シナリオ生成だけでなく、検索、修正、実行、評価までを連続して扱えるかが実務上の論点になる。PlannerForgeは、その連結部分にLLMを置いた場合の性能と限界を、10モデル・5条件・複数ベンチマークで示している。
日本への影響
日本の自動運転開発では、走行シナリオの作成・選別・編集・評価をつなぐ検証工程の効率が焦点になりうる。PlannerForgeが示したような工程連結型の評価枠組みは、シナリオテストを内製する事業者や研究機関にとって、LLMの適用範囲を見極める材料になる。