日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2609.14543

NavPatch: 視覚言語モデルによる証拠に基づく物体レベルコストマップ補正

NavPatch: Evidence-Guided Object-Level Costmap Correction with Vision-Language Models

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語モデルで物体を認識し、障害物マップに「追加・削除・拡張」の補正を施すことで、ケーブルやカーテンなど形状が実態と合わない物体への対処を改善した移動ロボットナビゲーション手法。

詳しい要約

1. どんなもの?

- モバイルロボットのナビゲーションにおける物体レベルのコストマップ補正レイヤー - 視覚言語モデル(VLM)を用いて、ナビゲーションに関連する物体カテゴリに対してADD, REMOVE, EXTENDの補正を割り当てる - オープンボキャブラリのグラウンディングで物体インスタンスを定位し、LiDARとRGB-D観測で3Dサポートを提供 - 観測品質フィルタリングとクロスフレームメンテナンスにより、各補正パッチのコミット、置換、取り消しを決定 - 50回の実ロボット試行(5つのレイアウト)で86.0%の成功率を達成

2. 先行研究と比べてどこがすごい?

- 従来の幾何学的地図に基づく障害物回避では、低いケーブルを見逃したり、柔軟なカーテンが誤ったブロックを生じたり、交通コーンが実際の占有領域より大きな除外領域を必要とする問題があった - 現在の観測のみに基づく更新と比較して、成功率を70.0%から86.0%に向上させ、誤コミット率を68.4%から40.7%に低減 - 物体レベルの補正を導入することで、ナビゲーションへの影響を適切に表現できる点が優れている

3. 技術・手法の肝は?

- 視覚言語モデル(VLM)による定期的なシーン理解で、ナビゲーション関連物体カテゴリにADD, REMOVE, EXTENDを割り当てる - オープンボキャブラリのグラウンディングで物体インスタンスを定位 - LiDARとRGB-D観測から3Dサポートを取得 - 観測品質フィルタリングとクロスフレームメンテナンスにより、補正パッチのコミット、置換、取り消しを判断

4. どうやって有効だと検証した?

- 5つのレイアウトで50回の実ロボット試行を実施し、全体成功率86.0%を達成 - 4つの構成で合計200回のアブレーション研究を実施 - 現在の観測のみに基づく更新と比較して、成功率が70.0%から86.0%に向上し、誤コミット率が68.4%から40.7%に減少することを示した

5. 議論はある?

- 要旨からは不明

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていないが、関連手法として視覚言語モデル(VLM)を用いたナビゲーション、オープンボキャブラリのグラウンディング、LiDARとRGB-Dを統合した3D知覚、コストマップ補正に関する研究が挙げられる

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shiji Sun, Xingyu Tao, Hao Wang, Ling Wang, Zhengyi Chen

分類: cs.RO

原文アブストラクト

Mobile robots typically rely on geometric maps for obstacle avoidance and path planning, but the resulting obstacle representation does not always match how an object should affect navigation. A low lying cable may be missed, a flexible curtain may create spurious blockage, and a traffic cone may require an exclusion region larger than its observed footprint. We present NavPatch, an object level correction layer that assigns ADD, REMOVE, or EXTEND to navigation relevant object categories through periodic scene understanding with a vision-language model. Open vocabulary grounding localizes object instances, and LiDAR and RGB-D observations provide 3D support. Observation quality filtering and cross frame maintenance determine when each correction patch is committed, replaced, or revoked. In 50 real robot trials across five layouts, NavPatch achieves an overall success rate of 86.0%. An ablation study of four configurations with 200 runs in total shows that NavPatch improves the success rate from 70.0% to 86.0% and reduces the false commit rate from 68.4% to 40.7% compared with updates based only on the current observation.

関連論文