日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.23354

OptiSight:意味推論と幾何制御を橋渡しする身体化ナビゲーション

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語モデルによる意味推論と視覚サーボによる幾何制御を組み合わせたハイブリッドな屋内ナビゲーション手法を提案。AI Habitatでのゼロショット実験で有効性を確認。

詳しい要約

1. どんなもの?

OptiSightは、屋内自律ナビゲーションのためのハイブリッドフレームワークである。Vision-Language Model (VLM)による意味推論と、決定論的visual servoingを組み合わせ、有限状態のChain-of-Thought (CoT)アーキテクチャを採用する。Grounded-SAMを用いてオープン語彙のターゲットをローカライズし、カメラ投影幾何学により密なマッピングを必要とせずに視覚観測をナビゲーションコマンドに変換する。VLMは重要な決定ポイントでのみクエリされ、計算オーバーヘッドを削減しつつ、幾何学的制御が連続的なナビゲーションを担う。AI Habitatでの実験により、多様な屋内シナリオでゼロショットナビゲーションを実証し、8 GB VRAMの制約内で動作する。

2. 先行研究と比べてどこがすごい?

従来の手法は、密なマッピングや明示的な意味マップに依存するか、VLMを頻繁に呼び出して計算コストが高い。OptiSightは、VLMの推論と幾何学的制御をハイブリッドに統合し、VLMのクエリを重要な決定ポイントに限定することで、計算オーバーヘッドを削減しつつ、意味理解と正確な幾何学的制御の両立を実現している。また、密なマッピングを必要としないため、軽量で実用的である。

3. 技術・手法の肝は?

手法の核心は、有限状態のCoTアーキテクチャにより、VLMの推論と決定論的visual servoingを切り替える点にある。Grounded-SAMがオープン語彙のターゲットを検出し、カメラ投影幾何学を用いてターゲットへの相対的なナビゲーションコマンドを生成する。VLMは、ターゲットの曖昧さや障害物回避などの高次の決定が必要な場合にのみ呼び出され、それ以外は幾何学的制御が連続的な動作を担う。これにより、計算資源を効率的に使用する。

4. どうやって有効だと検証した?

AI Habitatシミュレータを用いて、多様な屋内シナリオでゼロショットナビゲーションの実験を行った。障害物回避や意味的曖昧さを含む状況で有効性を検証し、8 GB VRAMのメモリ予算内で動作することを確認した。具体的な数値結果は要旨に記載されていない。

5. 議論はある?

要旨からは、VLMのクエリ頻度とナビゲーション性能のトレードオフや、実環境でのロバスト性、Grounded-SAMの検出精度への依存などについての議論は不明である。また、8 GB VRAMという制約は、より複雑なシナリオや大規模な環境でのスケーラビリティに影響する可能性があるが、詳細は不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Grounded-SAM、Vision-Language Model、visual servoing、AI Habitatが挙げられる。次に読むべき論文としては、Grounded-SAMの原著論文、VLMを用いたナビゲーションの代表的な研究(例:LM-Nav)、visual servoingの基礎論文、AI Habitatのプラットフォーム論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Alperen Avan, Jordi Sanchez-Riera

分類: cs.RO, cs.CV

原文アブストラクト

Autonomous indoor navigation requires both semantic understanding and precise geometric control. We propose OptiSight, a hybrid framework that combines Vision-Language Model reasoning with deterministic visual servoing through a finite-state Chain-of-Thought architecture. Grounded-SAM localizes open-vocabulary targets, while camera projection geometry converts visual observations into navigation commands without requiring dense mapping. The VLM is queried only at key decision points, reducing computational overhead while geometric control handles continuous navigation. Experiments in AI Habitat demonstrate reliable zero-shot navigation across diverse indoor scenarios, including obstacle avoidance and semantic ambiguity, while operating within an 8~GB VRAM budget. The source code is available at https://github.com/avanalperen/OptiSight-Python-Multimodal-CoT-for-Visual-Reasoning.

関連論文