何が起きたか

自動運転における推論手法のサーベイ論文が2026年8月31日に公開された。このサーベイは、テキスト型のChain-of-Thought(CoT)推論から、物理世界の時空間構造を共有する「行動接地型推論」への移行を分析する。対象は171論文で、うち130件が手法論文、41件がベンチマーク・データセット・サーベイ・分析論文。手法を4カテゴリ(言語ベース、視覚空間、潜在動的、外部化)に分類し、さらに13のサブタイプに細分化した。

詳細

サーベイは、自動運転の「答え」が連続的な行動であるため、推論が物理世界と同じ時空間構造を共有する必要があると指摘する。中間状態の形式を整理軸とする表現中心の分類法を提案し、130の手法を4カテゴリに分類。カテゴリは言語ベース、視覚空間、潜在動的、外部化の4つで、それぞれが関心領域(ROI)に対応する13のサブタイプに分かれる。プロジェクトページはGitHubで公開されている。

Key Facts

サーベイは171論文を対象とし、うち130件が手法論文、41件がベンチマーク・データセット・サーベイ・分析論文である。[1]
手法は4カテゴリ(言語ベース、視覚空間、潜在動的、外部化)に分類され、さらに13のサブタイプに細分化される。[1]
サーベイは、自動運転の推論がテキスト型CoTから行動接地型推論へ移行していると分析する。[1]
サーベイは、中間表現が実世界に接地され、リアルタイム行動に結合され、安全重視システムの下で検証可能であることが、運転エージェントの推論における未開拓のフロンティアであると示す。[1]
プロジェクトページはGitHubで公開されている。[1]

本紙の見方

本サーベイの核心は、自動運転の推論を「テキスト生成」から「行動生成」へと再定義した点にある。従来のCoTは言語的な中間ステップを生成するが、自動運転の出力は連続的な行動であり、推論過程が物理世界の時空間構造と整合しなければならない。この視点は、推論の評価軸を「言語的な妥当性」から「実世界への接地可能性」へと移すもので、分野のパラダイム転換を示唆する。 分類法の特徴は、中間状態の形式を軸に据えた点だ。言語ベースは従来のテキストCoTの延長線上にあるが、視覚空間・潜在動的・外部化は、それぞれ空間表現、潜在ダイナミクス、外部モジュールとの連携を中間表現とする。この分類は、単なる手法の羅列ではなく、推論の「表現形式」が行動生成にどう結びつくかを問うもので、今後の研究の整理に有用である。 業界構造への含意として、このサーベイは自動運転のAI開発において、計算資源やデータだけでなく「推論の表現形式」が競争軸になることを示す。特に、外部化推論は、車載計算機の制約を外部基盤で補う可能性があり、エッジとクラウドの役割分担に影響する。また、潜在動的推論は、シミュレーションと実世界のギャップを埋める技術として、データ効率の改善につながる可能性がある。 未確定の論点として、サーベイが示す「行動接地型推論」の具体的な実装方法や、各カテゴリの有効性を比較するベンチマークの整備が挙げられる。また、安全検証との統合がどのように進むかも今後の課題である。

なぜ重要か

自動運転のAI開発において、推論の「表現形式」が新たな競争軸となることを示す。テキスト型CoTから行動接地型への移行は、単なる技術トレンドではなく、安全検証や計算基盤の設計にまで影響を及ぼす可能性がある。