日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
物体検出arXiv:2608.15830

MITE-Net: 組み込みエッジSAR向けSWaP最適化4Kビデオ微小ターゲット認識

MITE-Net: SWaP-Optimized 4K Video Tiny Target Perception for Embodied Edge SAR

シェア:XThreadsFacebookLINEはてブBluesky

UAVなどのエッジデバイス向けに、SWaP制約下で4K映像から微小なターゲットをリアルタイムに認識するための軽量カスケードアーキテクチャMITE-Netを提案し、専用データセットとエッジデバイスでのベンチマークを提供した。

詳しい要約

1. どんなもの?

本論文は、組み込み型Search-and-Rescue (SAR)ミッションにおける4K高解像度映像からのリアルタイム微小目標認識を目的とした、SWaP最適化フレームワークを提案する。具体的には、新規アーキテクチャMITE-Net、専用データセットSAR-Tiny Datasets、ハードウェアベンチマークを含む。MITE-Netは、学習不要の生体模倣型Tiny Target Motion-Based Region Proposal Network (TTM-RPN)と、0.14Mパラメータ未満のR-CNNライクなヘッドを組み合わせたカスケード構造を持つ。SAR-Tiny Datasetsは、SeaDroneSee-TinyとUAVID-Tinyの2つのUAVデータセットを再ラベル付けして構築され、4K微小目標評価を標準化する。

2. 先行研究と比べてどこがすごい?

従来の高解像度映像処理では、画像ダウンサンプリングによる特徴損失や、スライス処理によるレイテンシ増大が問題であった。本手法は、学習不要の生体模倣型TTM-RPNを用いることで、SWaP制約下でも4K映像を直接処理し、リアルタイム性とエネルギー効率を両立する点が優れている。また、SAR-Tiny Datasetsを新たに構築し、4K微小目標評価の標準化を図った点も貢献である。

3. 技術・手法の肝は?

技術の肝は、学習不要の生体模倣型TTM-RPNによる動きベースの領域提案と、超軽量なR-CNNライクヘッドによるカスケード構造である。TTM-RPNは動き情報を利用して微小目標の候補領域を高速に抽出し、ヘッドがその領域を分類・回帰する。これにより、計算コストを抑えつつ高解像度映像の微小目標を検出する。また、SAR-Tiny Datasetsの構築により、4K微小目標の評価を可能にしている。

4. どうやって有効だと検証した?

NVIDIA Jetson AGX Xavierエッジデバイス上で、SeaDroneSee-TinyとUAVID-Tinyを用いて評価した。SeaDroneSee-Tinyでは、4K海事映像を直接処理し、100%の探索成功率を30.33 FPSで達成、消費電力3.19 W(9.51 FPS/W)で、YOLOベースラインを目標再現率とエネルギー効率で大幅に上回った。一方、UAVID-Tinyでは、都市背景に対する学習不要の生体模倣フロントエンドの限界と、超軽量ヘッドの表現能力不足が明らかになった。

5. 議論はある?

UAVID-Tinyの評価から、学習不要の生体模倣フロントエンドは都市背景のような複雑なシーンでは性能が低下し、超軽量ヘッドは複雑な特徴を表現する能力が不足するという構造的限界が示された。このことは、今後のエンドツーエンドSARアーキテクチャの設計において、学習可能な領域提案やより強力なヘッドの必要性を示唆している。また、SWaP制約と検出性能のトレードオフに関する議論がある。

6. 次に読むべき論文は?

要旨で参照されているYOLOモデル(YOLO系の物体検出器)や、R-CNNライクな検出器、また生体模倣型の動き検出に関する研究が関連する。具体的には、YOLOの最新版や、軽量な物体検出アーキテクチャ(例えばEfficientDetやMobileNet SSD)、および動きに基づく物体検出の研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Mingshuo Xu, Mu Hua, Jigen Peng, Qi Wang, Shigang Yue

分類: cs.CV

原文アブストラクト

Real-time tiny target perception in high-resolution imagery is critical for embodied Search-and-Rescue (SAR) missions. However, strict Size, Weight, and Power (SWaP) constraints on edge devices like UAVs create a bottleneck: traditional image downsampling causes severe feature loss, while slice-based processing incurs prohibitive latency. To address this gap, this paper introduces a comprehensive framework encompassing a novel architecture, specialized datasets, and hardware-level benchmarks. First, we propose MITE-Net, a SWaP-optimized cascaded architecture, which couples a bio-inspired, learning-free Tiny Target Motion-Based Region Proposal Network (TTM-RPN) with a sub-0.14M-parameter R-CNN-like head. Second, to standardize 4K tiny target evaluation, we construct the SAR-Tiny Datasets by relabeling two challenging UAV datasets: SeaDroneSee-Tiny (dynamic maritime scenes, tiny targets predominantly of 64-256 pixels ) and UAVID-Tiny (cluttered urban scenes, extremely tiny targets, less than 64 pixels). Third, we benchmark against state-of-the-art YOLO models on an edge device, NVIDIA Jetson AGX Xavier, where MITE-Net directly processes 4K maritime imagery, achieving a 100\% search success rate at 30.33 FPS. Consuming merely 3.19 W (9.51 FPS/W), MITE-Net vastly outperforms YOLO baselines in target recall and energy efficiency. Conversely, UAVID-Tiny evaluations expose a compound structural limitation: the learning-free bionic front-end struggles against urban backgrounds, while the ultra-lightweight head lacks representational capacity for complex features. Ultimately, this work delivers an efficient onboard perception paradigm and a rigorous baseline guiding future end-to-end SAR architectures.

関連論文