日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.18470

DevGRU: 衝突認識リカレントモデルを用いた深度誘導型視覚ナビゲーション

DevGRU: Depth-guided Visual Navigation using a Collision-aware Recurrent Model

シェア:XThreadsFacebookLINEはてブBluesky

深度画像と目標点に基づくナビゲーションシステムDevGRUを提案し、衝突を回避する将来軌道予測と衝突予測により、複雑な屋内環境でのナビゲーション性能を大幅に向上させた。

詳しい要約

1. どんなもの?

本論文は、深度画像と点ゴール条件を用いた視覚ナビゲーションシステム「DevGRU」を提案している。既存の視覚ナビゲーションモデルは複雑な屋内環境、特に構造化されたレイアウトや狭い通路で衝突しやすい問題に対処するため、衝突を考慮した将来軌道を生成するアクション予測器(AP)と衝突予測器を組み合わせ、ゴール位置推定の誤差を補償し、将来の逸脱を積極的に軽減する。

2. 先行研究と比べてどこがすごい?

既存の視覚ナビゲーションモデル(ViNT、NoMaD、NavDPなど)は、多様なプラットフォームへの一般化を目指すが、複雑な屋内環境での衝突が課題である。DevGRUは、深度画像と点ゴール条件を用い、衝突を考慮した将来軌道を生成することで、即時の障害物回避を可能にし、ゴール位置推定の誤差補償も行う点で優れている。また、モデルサイズが小さく、推論時間が高速である。

3. 技術・手法の肝は?

手法の核は、深度画像と点ゴール条件を入力とするアクション予測器(AP)と衝突予測器の併用である。APは衝突を考慮した将来軌道を生成し、衝突予測器はゴール位置推定の誤差を補償し、将来の逸脱を軽減する。これにより、即時の障害物回避と長期的なナビゲーション精度を両立している。

4. どうやって有効だと検証した?

9つの異なるシーンと、ViNT、NoMaD、NavDPの3つの最先端手法、およびViNTとNoMaDの4つの追加バリアントを用いて実験を実施した。ナビゲーション性能において、DevGRUはViNTとNoMaDを大幅に上回り、モデルサイズと推論時間ではNavDPをそれぞれ7倍、17倍上回る高速性を示した。

5. 議論はある?

要旨からは、提案手法の限界や特定の環境での性能低下などについての議論は不明である。また、他のベースラインとの比較は行われているが、実世界でのロボット展開に関する考察は要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されているViNT、NoMaD、NavDPの各論文が次に読むべき論文として挙げられる。また、関連する視覚ナビゲーションの分野では、RGB-Dナビゲーションや衝突回避のための深層強化学習手法なども参考になる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kyung Min Han, Eunsom Kim, Young J. Kim

分類: cs.RO

原文アブストラクト

Existing visual navigation models often aim to develop foundation models that can generalize robot navigation across diverse platforms. However, many of these models are prone to collisions when deployed in complex indoor environments, particularly in structured layouts and narrow passages. To address this problem, we propose a depth image- and point-goal-conditioned navigation system, DevGRU. The proposed system employs an action predictor (AP) that generates collision-aware future trajectories, enabling effective avoidance of immediate obstacles. In conjunction with a collision predictor, the AP further compensates for errors accumulated in the goal pose estimation and proactively mitigates future deviations. To evaluate our method, we conducted experiments across nine different scenes and three state-of-the-art approaches - ViNT, NoMaD, and NavDP - as well as four additional variants of ViNT and NoMaD. In terms of navigation performance, DevGRU significantly outperforms ViNT and NoMaD by a large margin. In addition, the proposed model has a relatively small number of trainable parameters, resulting in the fastest inference time among the baselines, particularly outperforming NavDP by 7x in model size and 17x in inference time.

関連論文