日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
惑星探査/認識arXiv:2608.28724v1

MANTLE: モジュラーアップリンク原理を用いた適応型惑星表面認識のためのフレームワーク

MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle

シェア:XThreadsFacebookLINEはてブBluesky

火星探査ローバーのための地形分類とボルダーセグメンテーションを同時に行うマルチタスクネットワークを提案。共有バックボーンを固定し、タスク特化ヘッドを地球で訓練してアップリンクするモジュラー設計が特徴。

詳しい要約

1. どんなもの?

MANTLEは、惑星表面探査ローバーのためのマルチタスク適応型ネットワークであり、地形分類とボルダーセグメンテーションの2つの知覚タスクを実行する。共有のDINOv2バックボーンとタスク固有のヘッド(分類ヘッドとセグメンテーションヘッド)で構成される。分類ヘッドはHiRISE軌道画像から構築されたデータセットで訓練され、セグメンテーションヘッドはMSL表面画像から構築されたデータセットで訓練される。

2. 先行研究と比べてどこがすごい?

先行研究では、各タスク(地形分類やボルダーセグメンテーション)が個別のモデルで扱われることが多く、共有表現やモジュール性が乏しかった。MANTLEは、共有バックボーンとタスク固有ヘッドを組み合わせることで、複数タスクを効率的に処理し、さらにModular Uplink Principleを導入して、地球で訓練した軽量ヘッドをアップロードするだけで新しい能力を追加できる点が新しい。

3. 技術・手法の肝は?

手法の肝は、共有のDINOv2バックボーン(凍結)とタスク固有のヘッド(分類ヘッドとセグメンテーションヘッド)を組み合わせたアーキテクチャと、Modular Uplink Principleである。この原理では、搭載されるのは共有の凍結バックボーンのみで、新しい知覚能力は地球で訓練された軽量ヘッドとしてアップロードされ、モデル全体を再訓練する必要がない。

4. どうやって有効だと検証した?

分類ヘッドは7つの火星地形クラスでテスト精度92.56%を達成し、セグメンテーションヘッドは検証IoU 0.753を達成し、未見のローバー走行からのホールドアウトテストセットで強いクロスソル汎化を示した。

5. 議論はある?

要旨からは、議論の詳細は不明。ただし、モジュール設計の拡張性や、異なるデータセット(HiRISEとMSL)の統合に関する課題、実運用でのアップリンクの実現性などが議論される可能性がある。

6. 次に読むべき論文は?

要旨で参照されている先行研究として、VikingからPerseveranceまでの火星ミッションが挙げられている。また、DINOv2バックボーンに関連する自己教師あり学習の研究や、HiRISE画像を用いた地形分類、MSL画像を用いたボルダー検出の研究が関連する。具体的には、DINOv2の元論文や、火星地形分類の既存研究を読むとよい。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Pranav Durai, Gary Doran

分類: cs.CV

原文アブストラクト

Planetary surface exploration missions rely increasingly on autonomous robotic platforms capable of interpreting complex terrain to ensure safe navigation, enable targeted science, and improve operational efficiency, as demonstrated across past Mars missions from Viking through Perseverance. Among the key perception capabilities, landform classification provides contextual information for landing site selection and scientific analysis, while boulder segmentation supports hazard assessment and path planning. This paper presents MANTLE, a multi-task adaptive network for terrain and landform extraction. The model uses a shared DINOv2 backbone for high-level feature extraction with task-specific heads: a classification head for large-scale landform classification, and a segmentation head for pixel-wise boulder localization, each trained on curated datasets built respectively from HiRISE orbital imagery and MSL surface-level imagery. The classification head achieved a test accuracy of 92.56% across seven Martian terrain classes, while the segmentation head achieved a validation IoU of 0.753 and showed strong cross-sol generalization on a held-out test set from previously unseen rover traverses. A key advantage of MANTLE is its modular, extensible design, formalized here as the Modular Uplink Principle: only a shared, frozen backbone needs to remain onboard, while subsequent perception capabilities are trained on Earth as lightweight task-specific heads and uplinked without retraining the full model. This work demonstrates two such high-impact capabilities, terrain classification and boulder segmentation, as an initial realization of a framework built to support many more over a mission's lifetime. With this foundation, future explorers need not arrive on Mars fully formed, but can continue to learn, adapt, and grow more capable with every uplink.