日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
深度推定arXiv:2608.03666

XiDepth: 自己教師あり単眼深度推定のための軽量かつ効率的なネットワーク

XiDepth: a Lightweight and Efficient Network for Self-supervised Monocular Depth Estimation

シェア:XThreadsFacebookLINEはてブBluesky

XiNet演算子ブロックに基づく軽量アーキテクチャXiDepthを提案し、KITTIデータセットで0.8Mパラメータで最先端性能を達成、Raspberry Pi 4での実装でFLOPsと消費電力を大幅削減した。

詳しい要約

1. どんなもの?

XiDepthは、自己教師あり単眼深度推定のための軽量かつ効率的なネットワークである。XiNetオペレータブロックに基づくアーキテクチャを採用し、特徴抽出を強化しつつ、計算複雑性とエネルギー消費を低く抑えることを目指す。KITTIデータセットで0.8Mパラメータという少ないパラメータ数で最先端の性能を達成し、Raspberry Pi 4上でのテストにより、組み込み環境での実用性を確認している。

2. 先行研究と比べてどこがすごい?

先行研究では、depth-wise convolutionやattention mechanismを採用するモデルが多いが、これらは高いエネルギー消費や組み込み環境での互換性問題を抱える。XiDepthは、XiNetオペレータブロックを用いることで、これらの問題を回避しつつ、性能を維持しながら計算量とエネルギーを削減する点が優れている。具体的には、主要手法と比較してFLOPsを40%、エネルギー消費を35%削減する。

3. 技術・手法の肝は?

手法の肝は、XiNetオペレータブロックをベースとした軽量アーキテクチャの設計にある。XiNetブロックは、効率的な特徴抽出を実現しつつ、計算複雑性とエネルギー需要を低く抑える。また、自己教師あり学習を用いることで、ground-truth depthを必要とせず、単眼カメラのセットアップのみで学習可能である。

4. どうやって有効だと検証した?

KITTIデータセットを用いて、自己教師あり単眼深度推定の標準的な評価指標(例:Abs Rel, Sq Rel, RMSEなど)で性能を検証し、0.8Mパラメータで最先端の性能を達成した。さらに、Raspberry Pi 4上での実装テストにより、組み込み環境での実行可能性を確認し、FLOPsとエネルギー消費の削減効果を主要手法との比較で示した。

5. 議論はある?

要旨からは、XiDepthの性能がKITTIデータセットでのみ検証されており、他のデータセットや実環境での汎用性については不明である。また、XiNetブロックの詳細な設計や、他の軽量化手法との比較についての議論は要旨には含まれていない。さらに、自己教師あり学習の限界(例:動的シーンや反射面での精度低下)についての考察もない。

6. 次に読むべき論文は?

要旨で参照されている先行研究は明示されていないが、自己教師あり単眼深度推定の分野では、Monodepth2やManyDepthなどの手法が関連する。また、軽量ネットワークの設計では、MobileNetやEfficientNetなどの一般的手法が参考になる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Elena Izzo, Riccardo Toniolo, Lamberto Ballan

分類: cs.CV

原文アブストラクト

Self-supervised monocular depth estimation has emerged as an appealing solution to design lightweight and effective models for deployment on computationally constrained devices due to its reduced reliance on expensive depth sensors. By eliminating the need for ground-truth annotations and leveraging the simplicity of monocular camera setups, this approach facilitates cost-effective data collection and broad applicability across fields such as computer vision and robotics. A critical challenge is achieving resource-efficient neural networks without compromising the overall performance. State-of-the-art models generally adopt depth-wise convolutions and attention mechanisms; however, these functions often incur high energy costs and face compatibility issues in embedded environments. To address this, we propose XiDepth, a lightweight architecture based on the XiNet operator block, designed to enhance feature extraction while maintaining low computational complexity and energy demand. On the KITTI dataset, XiDepth achieves state-of-the-art performance with only 0.8M parameters. Tests on a Raspberry Pi 4 further confirm its suitability for real-world embedded applications, reducing FLOPs by 40% and energy consumption by 35% compared to leading methods.

関連論文