何が起きたか

arXivに公開された論文で、視覚言語行動(VLA)モデルを用いたクロスエンボディメント航法の新フレームワーク「CrossTracer」が提案された。CrossTracerは、航法計画を画像平面上の正規化ウェイポイントとして表現し、意味推論と物理的接地の統一インターフェースを形成する。まずVL-Tracerが事前学習済みVLAモデルを適応させて初期航法トレースを予測し、次にCE-Adapterが視覚的な走行可能性キュー、ロボットの識別情報、初期トレースから身体条件付きの残差補正を予測する。補正モジュールの学習には、手動アノテーションを避けるため、CE-RRT*がパノプティックセグメンテーションをロボット条件付きの走行可能性コストマップに変換し、コスト最小化トレースを生成する。評価では、NaviTraceベンチマークで総合スコア45.68を達成し、汎用ベースラインのGemini-2.5-Proを10.01ポイント(相対28.1%向上)上回った。また、車輪型・脚型ロボットでの実機展開でも航法成功率と実行効率の改善が確認された。

Key Facts

CrossTracerは、VLAモデルが身体固有の移動制約を無視する問題に対処するため、航法計画を画像平面ウェイポイントとして表現する階層型フレームワークである。[0]
VL-Tracerが初期航法トレースを予測し、CE-Adapterが身体条件付き残差補正を予測する。[0]
CE-RRT*がパノプティックセグメンテーションからロボット条件付き走行可能性コストマップを生成し、手動アノテーションなしで補正モジュールを訓練する。[0]
NaviTraceベンチマークで総合スコア45.68を達成し、Gemini-2.5-Proを10.01ポイント上回った(相対28.1%向上)。[0]
車輪型・脚型ロボットでの実機展開で、航法成功率と実行効率の改善が確認された。[0]

なぜ重要か

VLAモデルはロボット航法に強力な意味的先行知識を提供するが、身体性の違いを無視すると物理的に実行不能な経路を生成する可能性がある。CrossTracerは、画像平面ウェイポイントという統一インターフェースと身体条件付き残差補正により、異なる身体性を持つロボット間で航法計画を適応させる手法を確立した。これにより、ロボットの種類に依存しない汎用的な航法モデルの実現に寄与し、実世界展開での成功率と効率向上が期待される。