何が起きたか

2026年3月19日、arXivに投稿された論文で、自動運転シーン向けの3Dトークナイザー「DriveTok」が提案された。DriveTokは、視覚基盤モデルから得た特徴を3D変形可能クロスアテンションでシーントークンに変換し、マルチビュートランスフォーマーでRGB、深度、セマンティクスを再構成する。nuScenesデータセットでの実験で、画像再構成、セマンティックセグメンテーション、深度予測、3D占有予測の各タスクで有効性が示された。

詳細

DriveTokは、視覚基盤モデルから意味的にリッチな視覚特徴を取得し、3D変形可能クロスアテンションを用いてシーントークンに変換する。デコード時には、マルチビュートランスフォーマーでシーントークンからマルチビュー特徴を再構成し、RGB、深度、セマンティクスの再構成を行う複数のヘッドを使用する。さらに、シーントークンに直接3Dヘッドを追加し、3Dセマンティック占有予測を行うことで空間認識を向上させる。複数の学習目的により、DriveTokはセマンティクス、幾何、テクスチャ情報を統合した統一シーントークンを学習する。

Key Facts

DriveTokは、3D運転シーンのトークン化手法であり、マルチビュー再構成と理解を統合する。[1]
DriveTokは、視覚基盤モデルから得た特徴を3D変形可能クロスアテンションでシーントークンに変換する。[1]
デコードにはマルチビュートランスフォーマーを使用し、RGB、深度、セマンティクスの再構成を行う。[1]
シーントークンに直接3Dヘッドを追加し、3Dセマンティック占有予測を行う。[1]
nuScenesデータセットでの実験により、画像再構成、セマンティックセグメンテーション、深度予測、3D占有予測で良好な性能を示した。[1]

なぜ重要か

DriveTokは、自動運転におけるマルチビューシーンの効率的な表現学習を可能にする可能性があり、視覚言語行動モデルや世界モデルの発展を支える基盤技術として注目される。今後の自動運転システムの認識性能向上に寄与する可能性がある。