日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
再ローカライゼーションarXiv:2609.12557

DRS-VPT: ビジョンポイントトランスフォーマーによるスキャンへの直接再ローカライゼーション

DRS-VPT: Directly Relocalizing in a Scan with Vision Point Transformers

シェア:XThreadsFacebookLINEはてブBluesky

クエリ画像と参照3D点群からスキャンの姿勢と点マップを予測し、カメラ-LiDARキャリブレーションや屋内再ローカライゼーションを統合的に行うフィードフォワードトランスフォーマーを提案。

詳しい要約

1. どんなもの?

- DRS-VPTは、画像からスキャンへの登録を直接行うフィードフォワードTransformerアーキテクチャ。 - クエリ画像と参照3D点群が与えられると、スキャンポーズと点マップ、各カメラのポーズと点マップを最初のカメラ座標系で予測する。 - さらに、スキャンを最初の画像に直接再投影アライメントするための、点ごとおよびピクセルごとの特徴の粗から細へのピラミッドを予測する。 - この定式化は、自動運転におけるカメラ-LiDARキャリブレーションや屋内カメラ-to-マップ再ローカリゼーションなどの下流タスクを統合する。

2. 先行研究と比べてどこがすごい?

- 単一のDRS-VPTモデルが、自動運転における画像-to-LiDAR登録で最先端性能を達成。 - マップ固有の重みを訓練することなく、競争力のある屋内再ローカリゼーションを実現。 - 未見環境への強いゼロショット転移を示す。 - 背面向き点のオクルージョンなど、複雑なスキャン-to-画像投影特性を学習することを定性的に示す。

3. 技術・手法の肝は?

- フィードフォワードTransformerアーキテクチャを採用。 - クエリ画像と参照3D点群から、スキャンポーズと点マップ、各カメラのポーズと点マップを最初のカメラ座標系で予測。 - 点ごとおよびピクセルごとの特徴の粗から細へのピラミッドを予測し、スキャンを最初の画像に直接再投影アライメント。 - これにより、カメラ-LiDARキャリブレーションや屋内再ローカリゼーションなどのタスクを統合。

4. どうやって有効だと検証した?

- 自動運転における画像-to-LiDAR登録で最先端性能を達成。 - 屋内再ローカリゼーションで競争力のある性能を、マップ固有の重みなしで実現。 - 未見環境への強いゼロショット転移を確認。 - 背面向き点のオクルージョンなど、複雑なスキャン-to-画像投影特性を学習することを定性的に示す。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究や関連手法は明記されていない。同分野の定番として、image-to-LiDAR registration、camera-LiDAR calibration、indoor relocalization、zero-shot transferに関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Lanke Frank Tarimo Fu, Maurice Fallon

分類: cs.CV, cs.RO

原文アブストラクト

We present DRS-VPT, a feed-forward transformer architecture for foundational image-to-scan registration. Given query images and a reference 3D point cloud, the model predicts the scan pose and point map alongside the poses and point maps of each camera, all expressed in the first camera's frame. It additionally predicts a coarse-to- fine pyramid of per-point and per-pixel features for direct reprojective alignment of the scan to the first image. This formulation unifies downstream tasks such as camera-LiDAR calibration in autonomous driving and indoor camera-to-map relocalization. A single DRS-VPT model achieves state-of-the-art performance for image-to-LiDAR registration in autonomous driving, competitive indoor relocalization without training map-specific weights, and strong zero-shot transfer to unseen environments. We also show qualitatively that the model learns complex scan-to-image projection properties such as occlusion of back-facing points.