何が起きたか
arxiv.orgは2026-10-07、NavGPT-3: Harnessing Context in a Hierarchical Navigation Runtimeを公開した。NavGPT-3は、推論・行動・監視を別々のスレッドとして扱い、各スレッドにコンテキスト、ツール、権限を持たせた上で、ランタイムがロボットの動作制御を切り替える仕組みである。これにより、突然の実世界イベントに対して中断やスレッド切り替えで応答できるとしている。
詳細
基盤下部のNavGPT VLAは19.28M例で学習され、codec allocationによりシーン変化に応じて視覚トークンを配分する設計だという。8Bモデル単体ではR2R-CEで74.51 SR、RxR-CEで78.19 SRを記録した。 完全版のNavGPT-3はR2R-CEで81.51 SRを達成し、RxR-CEでは成功率90.43 SR、path fidelity 78.47 nDTW、1エピソードあたり1分22秒を示した。論文は、NavGPT VLAが経路を実行する場合、推論ループが短くなり、言語モデルの1回の判断に対する最小反応時間が3〜19秒から、アクションポリシーの各ステップで0.5〜1秒(1〜2 Hz)に下がるとしている。
Key Facts
| NavGPT-3は、推論・行動・監視を別スレッドで扱う階層型のナビゲーション実行基盤である。 | [1] |
| NavGPT VLAは19.28M例で学習された。 | [1] |
| NavGPT VLAの8BモデルはR2R-CEで74.51 SR、RxR-CEで78.19 SRを記録した。 | [1] |
| NavGPT-3はR2R-CEで81.51 SRを達成し、RxR-CEで90.43 SRだった。 | [1] |
| 論文は、NavGPT VLAが経路を実行すると最小反応時間が3〜19秒から0.5〜1秒に下がるとしている。 | [1] |
本紙の見方
NavGPT-3の新しさは、単なるナビゲーション性能の改善ではなく、言語モデルの推論と低レイテンシーな行動制御を、権限付きのスレッド群として束ねる実行基盤を前面に出した点にある。R2R-CEの81.51 SRやRxR-CEの90.43 SRという数値自体も重要だが、より本質的なのは、言語モデルが判断し、アクションポリシーが即応し、ランタイムがどちらを操縦権に置くかを切り替える構造を示したことだとみられる。ここでは高レベルの推論と低レベルの物理制御を単線化せず、割り込みとスレッド切り替えで接続している。 この点は、同論文が示す反応時間の差に表れている。言語モデルの1回の判断に対する最小反応時間が3〜19秒なのに対し、アクションポリシーでは0.5〜1秒に縮む。つまり、NavGPT-3は高性能モデルをそのままロボットに載せる話ではなく、遅い推論と速い制御の境界をどう設計するかを主題にしている。NavGPT VLAが19.28M例で学習され、codec allocationでシーン変化に応じて視覚トークンを配分する点も、単なる視覚言語モデルではなく、走行中の環境変化に合わせて計算資源を振り分ける設計として読める。 本紙の関連記事はないため、過去報道との接続はできない。業界構造への含意としては、屋内ナビゲーションの競争軸が「経路を当てる精度」だけでなく、「いつ言語モデルに判断させ、いつ実行ポリシーに譲るか」という制御階層に移っている可能性がある。ここで焦点になるのは、評価指標のSRやnDTWだけでなく、実機での割り込み処理、ツール権限の設計、1〜2 Hzで動く行動層がどこまで安全に運用できるかである。なお、論文はモデル、コード、評価記録を公開するとしているが、実環境での台数、対象ロボット、運用条件は本文だけでは詰め切れない。
なぜ重要か
arxiv.orgによれば、NavGPT-3はR2R-CEで81.51 SR、RxR-CEで90.43 SRを示し、言語モデルの判断と低レイテンシー制御の切り替えを実装している。これは、ロボットの実運用で遅延の大きい推論と即応制御をどう分離するかという課題に、具体的な実装案を与える。
日本への影響
日本企業にとっては、ナビゲーション精度そのものだけでなく、実機の制御層と推論層をどう分けるかが論点になる。本文が示す0.5〜1秒の反応時間や権限付きスレッド設計は、移動体・サービスロボット・屋内搬送機の制御アーキテクチャの検討材料になりうる。