日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
水中ロボット/マルチモーダル融合arXiv:2608.19710

劣化した視覚条件下での水中ロボットのためのロバストなクロスモーダル基盤モデル認識

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

シェア:XThreadsFacebookLINEはてブBluesky

濁りや減衰などで劣化した水中画像に対し、ソナー情報を適応的に融合する手法を提案。視覚エンコーダは凍結したDINOv2を用い、劣化度に応じてソナーの寄与を自動調整し、極端な劣化下で精度を33.5%向上させた。

詳しい要約

1. どんなもの?

水中ロボットの視覚認識は、濁度、波長依存減衰、低照度、散乱、ぼけなどにより劣化する。本研究は、視覚エンコーダに凍結したDINOv2を用い、ソナー情報を補完的に融合することで、劣化条件下でのロバスト性を向上させる手法を提案する。クリーンから極端な劣化までの5段階のベンチマークを構築し、視覚とソナーの融合を劣化全体にわたって学習する。

2. 先行研究と比べてどこがすごい?

従来の視覚-ソナー研究は特徴量アライメントや名目上の検出性能に焦点を当てていたが、本研究は視覚の信頼性が低下する際のクロスモーダルロバスト性を調査する点が新しい。また、事前学習済みの視覚基盤モデル表現をソナーで補完できるかを評価し、劣化を考慮したゲート付き融合を導入する点が先行研究と異なる。

3. 技術・手法の肝は?

手法の肝は、視覚エンコーダ(DINOv2)とソナーエンコーダを凍結したまま、融合メカニズムのみを劣化の全範囲で学習することである。これにより、事前学習済みバックボーンを微調整せずに、モダリティの寄与を適応的に変化させる。具体的には、劣化を考慮したゲート付き融合(degradation-aware gated fusion)を用いる。

4. どうやって有効だと検証した?

クリーンから極端な視覚条件までの5段階のベンチマークを構築し、従来の視覚検出、凍結基盤モデル表現、ソナーコンテキスト、固定マルチモーダル融合、クリーン学習適応ゲーティング、劣化認識ゲート付き融合を比較した。極端な複合劣化下で、DINOv2ベースラインはbalanced accuracy 0.4610、提案手法は0.6152(相対33.5%向上)を達成。ソナーの寄与はクリーン時14.2%から極端劣化時41.3%に増加し、適応的な再分配を示した。

5. 議論はある?

融合は重度の濁度とぼけで最大の利得をもたらすが、色減衰のみでは追加の利得がほとんどない。基盤モデル表現は深刻な情報損失下でも価値があるが不十分であり、モダリティ信頼性に明示的に適応する融合がロバストな水中マルチモーダル認識を改善できることを示す。ただし、要旨からは他の劣化タイプや実環境での検証、計算コストなどの議論は不明。

6. 次に読むべき論文は?

要旨で参照されているDINOv2(視覚基盤モデル)、および視覚-ソナー融合の関連研究。具体的には、DINOv2の元論文、および視覚とソナーの特徴量アライメントや融合に関する既存研究(例:cross-modal feature alignment, multimodal fusion for underwater perception)が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Mohammad Arif Ul Alam

分類: cs.CV, cs.AI

原文アブストラクト

Reliable underwater robotic perception remains difficult because optical imagery degrades under turbidity, wavelength-dependent attenuation, low illumination, scattering, and blur. Although sonar provides complementary information that is less affected by optical visibility, prior visual-sonar research has largely focused on feature alignment and nominal detection performance. We investigate cross-modal robustness as visual reliability deteriorates and assess whether pretrained visual foundation-model representations can be complemented by sonar under severe degradation. We use frozen DINOv2 as the visual encoder and construct a controlled five-level benchmark ranging from clean to extreme visual conditions. We compare conventional visual detection, frozen foundation-model representations, sonar context, fixed multimodal fusion, clean-trained adaptive gating, and degradation-aware gated fusion. Our method trains the fusion mechanism across the full range of degradation while keeping the visual and sonar encoders frozen, allowing modality contributions to adapt without fine-tuning the pretrained backbone. Under extreme combined degradation, the DINOv2 baseline achieves 0.4610 balanced accuracy, while degradation-aware visual-sonar fusion reaches 0.6152, a 33.5% relative improvement. The learned sonar contribution increases from 14.2% under clean conditions to 41.3% under extreme degradation, demonstrating adaptive redistribution of cross-modal reliance. Fusion provides the largest gains under severe turbidity and blur, whereas color attenuation alone yields little additional benefit. These results show that foundation-model representations remain valuable but insufficient under severe information loss, and that explicitly adapting fusion to modality reliability can improve robust underwater multimodal perception.