何が起きたか

2026年8月15日にarXivに公開された論文(arXiv:2608.15284v1)で、VTInstructorが提案された。これは、連続環境におけるVLN指示生成のための初のフレームワークであり、自己中心視点のRGBビデオからナビゲーション指示を生成する。VTInstructorは、R2R-CEおよびRxR-CEのVal Unseenベンチマークにおいて、すべての標準NLG指標で新たなSOTAを達成し、最強ベースラインをそれぞれCIDErで+0.357および+0.109上回った。

詳細

従来の指示生成器は、パノラマ観測を持つ離散視点グラフを前提としており、軌跡構造が明示的であった。しかし連続環境では、エージェントは密なRGBストリームのみを受け取り、軌跡の手がかりの回復が困難である。VTInstructorは、暗黙的な軌跡ジオメトリを明示的な視覚軌跡プロンプトに変換する。具体的には、EDTCが長いRGB軌跡をナビゲーションに重要なキーフレームに凝縮し、VTPが経路・曲がり角・目標の手がかりをこれらのアンカーに重ね、VTModが結果の軌跡信号を視覚エンコーダに注入し、VT-GRPOがトレーニング中にこの空間注入を調整する。これらはすべて、ナビゲーショングラフ、事前構築マップ、シーン再構築を必要としない。

Key Facts

VTInstructorは、連続環境向けの初のVLN指示生成フレームワークである。出典一覧
VTInstructorは、R2R-CE Val Unseenで最強ベースラインをCIDErで+0.357上回った。出典一覧
VTInstructorは、RxR-CE Val Unseenで最強ベースラインをCIDErで+0.109上回った。出典一覧
VTInstructorが生成した指示により、凍結フォロワーの成功率が63.3%に達した。出典一覧
VTInstructorの指示は、最良の競合指示源と比較して成功率を+14.7パーセントポイント向上させた。出典一覧
VTInstructorは、下流のナビゲーションタスクで一貫したデータ拡張効果(+3 SRポイント)を提供した。出典一覧
VTInstructorは、EDTC、VTP、VTMod、VT-GRPOの4つのコンポーネントで構成される。出典一覧
VTInstructorは、ナビゲーショングラフ、事前構築マップ、シーン再構築を必要としない。出典一覧

なぜ重要か

VTInstructorは、連続環境でのVLN指示生成における新たなベンチマークを確立し、従来の離散視点グラフに依存しないアプローチを提示した。これにより、人間とロボットのインタラクションや大規模データセット構築の可能性が広がる。