何が起きたか

研究チームは2026年8月31日、事前学習済みVLMの空間知能を直接ロボット制御に引き出す汎用身体化ナビゲーションモデル「LightNav-0」を発表した。同モデルは、タスク固有の予測ヘッドを必要とせず、指示追従、オープンボキャブラリ物体ナビゲーション、視覚追跡を単一モデルで実現する。訓練コーパスは2K以上のシーンと4K時間以上の身体化ナビゲーションデータで構成され、10の公開ナビゲーションシミュレーション設定で単眼成功率の最高水準を達成した。

詳細

LightNav-0は、事前学習済みVLMの空間知能をナビゲーションに整合させるコンパクトな汎用モデルである。多様なナビゲーションタスクを統一トークンインターフェースで表現し、デュアルチャネルポインティングがタスク・シーン・身体性に依存しない空間意図を表現し、残差ベクトル量子化アクショントークナイザーがその意図を身体性固有の軌道に変換する。時間的に認識された視覚履歴圧縮、ER中間訓練、教師あり微調整、強化学習を組み合わせる。LightNav-0の初期化に使われるLightNav-ERは、8つの身体化推論ベンチマークで完全セット平均の最高値を達成し、LightNav-0は10の公開ナビゲーションシミュレーション設定すべてで単眼成功率の最高水準を達成した。実世界評価では、異なるロボット形態、多様なシーン、静的・動的ターゲットに対するゼロショット汎化を示した。

Key Facts

LightNav-0は、事前学習済みVLMの空間知能を活用し、タスク固有の予測ヘッドなしでナビゲーションに整合させるコンパクトな汎用モデルである。[1]
訓練コーパスは2K以上のシーンと4K時間以上の身体化ナビゲーションデータで構成される。[1]
LightNav-0は、10の公開ナビゲーションシミュレーション設定すべてで単眼成功率の最高水準を達成した。[1]
LightNav-ERは、8つの身体化推論ベンチマークで完全セット平均の最高値を達成した。[1]
実世界評価では、異なるロボット形態、多様なシーン、静的・動的ターゲットに対するゼロショット汎化を示した。[1]

本紙の見方

LightNav-0の核心は、既存のナビゲーションシステムがタスクや身体性ごとに個別のコンポーネントを積み上げてきたのに対し、事前学習済みVLMの空間知能を直接ロボット制御に引き出す点にある。タスク固有の予測ヘッドを排除し、統一トークンインターフェースで多様なタスクを表現することで、指示追従、物体ナビゲーション、視覚追跡を単一モデルで扱う。これは、知覚・推論・行動を分断してきた従来のアーキテクチャに対する構造的な転換であり、VLMを身体化ナビゲーションの統一バックボーンとして位置づける試みといえる。 訓練データの規模(2K以上のシーン、4K時間以上)は、実世界の多様性を反映するための基盤であり、10のシミュレーション設定での最高水準の成功率は、このデータ量とER中間訓練の効果を示している。特に、LightNav-ERが8つの身体化推論ベンチマークで最高値を達成したことは、ナビゲーションの前提となる空間推論能力の強化が、最終的なナビゲーション性能に寄与していることを示唆する。 業界構造への含意として、このアプローチは、ロボットごとに特化したナビゲーションモジュールを開発する従来の手法に比べ、開発コストと汎化の壁を低減する可能性がある。VLMの空間知能を活用することで、異なるロボット形態や環境への転用が容易になり、身体化AIの実用化を加速させる可能性がある。一方で、実世界評価はゼロショット汎化を示すが、その評価規模や具体的なロボットプラットフォームは公開情報からは不明であり、実用化にはさらなる検証が必要である。 未確定の論点として、LightNav-0のモデルサイズや計算コスト、実世界での成功率の詳細、また、動的ターゲットや複雑な環境での限界が挙げられる。さらに、VLMの空間知能を引き出す手法が、他の身体化タスク(操作など)にも拡張可能かどうかが次の焦点になる。

なぜ重要か

LightNav-0は、VLMを身体化ナビゲーションの統一バックボーンとして確立する可能性を示す。これにより、ロボットのナビゲーションシステム開発は、タスク固有のモジュール設計から、事前学習済みモデルの活用へとパラダイムシフトする可能性がある。