日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.08814

360CityArena: 具身エージェントのための現実的な仮想都市ナビゲーションベンチマーク

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

シェア:XThreadsFacebookLINEはてブBluesky

360度動画から構築した写実的な都市環境で、具身エージェントの都市探索能力を評価するベンチマークを提案。人間と最先端モデルの性能差が大きいことを示した。

詳しい要約

1. どんなもの?

360CityArenaは、360度ビデオから構築されたフォトリアリスティックな都市環境において、身体化エージェントの都市探索能力を評価するためのベンチマークである。東京・秋葉原地区を602本の360度ビデオセグメント(85ストリート)で再現し、175の人手によるタスクを含む。タスクはEnvironment Understanding、Path Reasoning、Spatial Reasoningの3カテゴリに分類され、位置特定、ランドマーク探索、経路計画、関係性空間推論など、都市探索に必要な基本能力を評価する。

2. 先行研究と比べてどこがすごい?

既存の屋外ベンチマークは、フォトリアリズムまたは複雑さが不足しており、実世界の都市環境とのギャップが大きい。360CityArenaは、実写の360度ビデオを用いた現実的な再構築により、高いフォトリアリズムと複雑な都市構造を提供し、より現実に近い評価を可能にしている点が優れている。

3. 技術・手法の肝は?

手法の肝は、360度ビデオから構築したフォトリアリスティックな環境と、人手で厳選されたタスク設計にある。タスクは都市探索に必要な能力をカバーする3カテゴリ(環境理解、経路推論、空間推論)に分類され、エージェントの総合的な能力を評価する。また、LMMベースのエージェントを評価に用いることで、最新のモデルの性能を測定する。

4. どうやって有効だと検証した?

最先端のLMMベースのエージェント(例:Gemini 2.5 Flash)を評価し、人間の性能(77.3%)と比較してGemini 2.5 Flashは17.1%と大幅に低いことを示した。これにより、ベンチマークが現実的な都市規模のナビゲーションと推論における課題を明らかにすることを検証した。

5. 議論はある?

要旨からは、ベンチマークの限界や改善点についての議論は不明。ただし、最強モデルでも人間に遠く及ばない結果は、現在のLMMベースのエージェントが都市規模の探索と推論に大きな課題を抱えることを示唆している。

6. 次に読むべき論文は?

要旨で参照されているLMMベースのエージェント(Gemini 2.5 Flashなど)や、関連する屋外ベンチマーク(例:photorealistic simulationを用いたナビゲーションベンチマーク)が挙げられる。具体的な論文名は要旨にないため、同分野の定番として、HabitatやMatterport3Dなどのシミュレーションベンチマークが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

分類: cs.CV, cs.AI, cs.LG

原文アブストラクト

We present 360CityArena, a benchmark for evaluating the urban exploration capabilities of embodied agents within a photorealistic environment constructed from 360-degree videos. Existing outdoor benchmarks either lack sufficient photorealism or complexity, resulting in a considerable gap from real-world urban environments. 360CityArena is built on a realistic reconstruction of the Akihabara district in Tokyo, Japan, using 602 360-degree video segments covering 85 streets, and consists of 175 meticulously human-crafted tasks. It encompasses three task categories: Environment Understanding, Path Reasoning, and Spatial Reasoning, covering fundamental abilities required for urban exploration, such as localization, landmark search, path planning, and relational spatial reasoning, thereby enabling comprehensive evaluation in realistic urban scenes. Our evaluation using state-of-the-art LMM-based agents shows that even the strongest model, Gemini 2.5 Flash, performs far below human level (human: 77.3% vs. Gemini 2.5 Flash: 17.1%), revealing substantial challenges that remain in city-scale embodied navigation and reasoning. 360CityArena provides a necessary and challenging testbed for photorealistic urban-district navigation and spatial reasoning.

関連論文