日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
姿勢推定arXiv:2609.26561

合成データのみで訓練した視覚基盤モデルによる宇宙機の単眼姿勢推定

Vision Foundation Models with Synthetic-Only Training for Monocular Spacecraft Pose Estimation

シェア:XThreadsFacebookLINEはてブBluesky

DINOv3をLoRAで適応し合成データのみで訓練することで、宇宙機の単眼姿勢推定精度を従来手法より大幅に改善し、Jetson Orin NX上での組み込み推論の実現可能性も示した。

詳しい要約

1. どんなもの?

- 単眼画像からの宇宙機姿勢推定(spacecraft pose estimation)の改善手法を提案。 - 既存のheatmap-based pose estimationアーキテクチャに、大規模自己教師ありViT基盤モデル(DINOv3)を適用。 - 合成データのみで訓練し、SPEED+のlightboxおよびsunlampテストセットで評価。 - パラメータ数300Mから840Mに拡大し、精度向上を確認。 - Jetson Orin NX 16GB上で推論時間133.8 ms/crop、消費電力32.0 Wを計測。

2. 先行研究と比べてどこがすごい?

- 従来の小型CNNやViTエンコーダの代わりに、大規模自己教師ありViT(DINOv3)を採用。 - パラメータ数を300Mから840Mに増やし、飽和が見られないことを示した。 - 合成データのみの訓練で、lightboxとsunlampの両ドメインにおいて既存手法を上回る精度を達成。 - 具体的には、sunlampで平均回転誤差1.56°、lightboxで1.17°を記録し、EagerNetの2.66°、1.75°を改善。 - 組込み推論の実現可能性をJetson Orin NXで実証。

3. 技術・手法の肝は?

- 既存のheatmap-based pose estimationアーキテクチャをベースに、エンコーダをDINOv3 840Mに置き換え。 - DINOv3をLoRA(rank 64)で適応。 - 3シードのアンサンブルと4回転のテスト時拡張(test-time augmentation)を適用。 - 訓練は合成データのみ。 - 推論はJetson Orin NX 16GB上で評価。

4. どうやって有効だと検証した?

- SPEED+のlightboxおよびsunlampテストセットで評価。 - 平均回転誤差を指標とし、sunlampで1.56°、lightboxで1.17°を達成。 - 先行研究のEagerNet(sunlamp 2.66°、lightbox 1.75°)と比較して改善を確認。 - Jetson Orin NX 16GB上で推論時間133.8 ms/crop、消費電力32.0 Wを計測し、組込み推論の実現可能性を検証。

5. 議論はある?

- パラメータ数増加に伴う精度向上が飽和していないことを示唆。 - 合成データのみの訓練で実データドメイン(lightbox, sunlamp)に汎化できることを実証。 - 組込みプロセッサ(Jetson Orin NX)での推論が可能であることを示し、軌道実績のあるプロセッサファミリでの実装可能性に言及。 - ただし、計算資源やリアルタイム性に関する詳細な議論は要旨からは不明。

6. 次に読むべき論文は?

- EagerNet(比較対象として言及) - DINOv3(基盤モデルとして使用) - SPEED+(ベンチマークデータセット) - heatmap-based pose estimation(ベースアーキテクチャ) - LoRA(適応手法)

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: John Church, Vazghen Nikolian

分類: cs.CV, cs.RO

原文アブストラクト

We present an improvement on previous spacecraft pose estimation architectures that results in the lowest published mean rotation errors we know of on the SPEED+ lightbox and sunlamp test sets for a known, non-cooperative spacecraft. By using a previously established heatmap-based pose estimation architecture and adapting a large self-supervised ViT foundation model (DINOv3) in place of the smaller convolutional and ViT encoders of previous work, we show that pose estimation accuracy improves from 300M to 840M parameters with no saturation yet observed. We also evaluate our 840M model on a Jetson Orin NX 16GB, measuring single-pass network inference at 133.8 ms per crop with a board draw of 32.0 W. These measurements demonstrate embedded inference feasibility on a processor family with orbital flight heritage. Our resulting model outperforms previous models across lightbox and sunlamp domains while training only on synthetic data. Our best model, using DINOv3 840M adapted with LoRA as the encoder (rank 64, three-seed ensemble with four-rotation test-time augmentation), results in $1.56^\circ$ mean rotation error on sunlamp and $1.17^\circ$ on lightbox, compared to the previous best mean rotation errors we know of on these test sets, $2.66^\circ$ and $1.75^\circ$ by EagerNet.

関連論文

PR本紙発行元 EmplifAI