何が起きたか
arxiv.orgは2026-09-20、Structured World-State Reasoning for Agentic Robotic Searchを掲載し、WORLDS: World-state Observation and Reasoning for Language-guided Discovery and Searchを発表した。CityNavの全5,311テストエピソードでナビゲーション成功率51.8%を記録し、これまでに公表された最高値を15.7ポイント上回った。1,000共有エピソードでは50.0%で、同じモデル、事前情報、センシングスタック、移動予算を使う最強適応ベースラインの27.9%を上回った。
詳細
WORLDSは、地理的事前情報から初期化した永続グラフに推論を接地し、知覚で更新する構成である。複数のParallel Reasonersが競合する候補解釈を並行維持し、観測の要請で差を詰める。収集・処理された観測はmultimodal Examinerが確認し、その後Judgeが接地された目標を選ぶか、再度の探索を求める。 論文は、Examinerによる観測ベースの検証が成功率に5.9ポイント寄与したとしている。また、推論負荷を下げた設定でもWORLDSは適応GeoNavベースラインを18.8ポイント上回り、生成トークン数は少なかった。加えて、四回転翼機で生成したセンシング用ウェイポイントを飛行させ、地図にない車両を含む3つの言語ターゲットをオンボード画像から接地したと報告している。
Key Facts
| WORLDSは、地理的事前情報から初期化した永続グラフを更新しながら推論する言語誘導探索フレームワークである。 | [1] |
| CityNavの全5,311テストエピソードでナビゲーション成功率51.8%を示した。 | [1] |
| この51.8%は、これまでに公表された最高値を15.7ポイント上回る。 | [1] |
| 1,000共有エピソードでは50.0%で、最強適応ベースラインの27.9%を上回った。 | [1] |
| 四回転翼機で、地図にない車両を含む3つの言語ターゲットをオンボード画像から接地した。 | [1] |
本紙の見方
WORLDSの新規性は、ロボット探索を「指示に従って移動する」問題ではなく、永続グラフを持つ世界状態推論として扱った点にある。地理的事前情報で初期化し、観測で更新し、さらにParallel ReasonersとJudgeを分離して候補解釈の競合を扱う構造は、単一モデルの一発推論よりも、探索中に証拠を集めて判断を修正する設計だと読める。ここで主役はハードウェアではなく、探索前に持つ地図知識、探索中に集める観測、最後に接地された目標を選ぶ推論手順の連結である。 本紙の見方としては、51.8%という総合成功率よりも、1,000共有エピソードで50.0%を出し、同じモデル・事前情報・センシングスタック・移動予算のベースライン27.9%を上回った点が重要である。つまり差はセンサーや移動量の増加ではなく、観測の集め方と解釈の流れにある可能性が高い。さらに、Examinerによる観測ベース検証が5.9ポイント寄与したという記述は、推論だけでなく「どの証拠を取りに行くか」が性能に効いていることを示す。これは、探索ロボットの評価軸が最終到達率だけでなく、証拠取得の設計に移りつつあることを示唆する。 業界構造への含意としては、移動制御・視覚認識・言語理解を別々に最適化するより、地理情報、観測取得、候補比較、判定を一体化した推論基盤の競争になる可能性がある。とりわけ、地図にない車両を3ターゲットの一つとして接地できた点は、静的地図だけでは足りない環境での運用を意識した設計に見える。一方で、論文段階ではCityNavのどの地形・環境で性能が出たのか、四回転翼機での実証がどの程度一般化できるのか、推論負荷を下げた設定での再現性が他の移動体や別データセットでも維持されるのかは未確定である。次に確認すべきなのは、実機での成功率、失敗ケースの内訳、観測要求回数、トークン削減が運用遅延にどう影響するかである。
なぜ重要か
論文が示す51.8%と50.0%は、ロボット探索の性能差が移動機構だけでなく、地図・観測・推論の接続方法で生まれることを示す。特に、同一のモデル、事前情報、センシングスタック、移動予算で27.9%から50.0%まで差が出た点は、既存機体への組み込み余地を示す材料である。
日本への影響
日本企業や研究機関にとっては、地図、観測、言語推論をつなぐ基盤設計が論点になる。移動体そのものより、地理情報処理、マルチモーダル認識、実機での証拠取得の設計に強みがあるかが問われる。