日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
シーングラフarXiv:2609.31005

TrackGraph: 画像空間トラッキングによるオンラインオープン語彙3Dシーングラフ

TRACKGRAPH: Online Open-Vocabulary 3D Scene Graphs via Image-Space Tracking

シェア:XThreadsFacebookLINEはてブBluesky

画像ストリーム上でマスクの同一性を追跡してから3Dに統合することで、高頻度かつ省メモリにオンラインでオープン語彙3Dシーングラフを構築する手法。

詳しい要約

1. どんなもの?

- オンラインで動作する open-vocabulary 3D scene graph 構築システム TRACKGRAPH を提案。 - 画像ストリーム内で短期的な 2D mask identity を維持してから 3D に統合する点が特徴。 - 階層的 scene graph 内に class-agnostic な 3D segment layer を持ち、open-vocabulary retrieval を可能にする。 - ロボットが自然言語で未知環境を推論することを狙う。

2. 先行研究と比べてどこがすごい?

- 既存システムは入力画像ごとに segmentation し、検出を永続的な 3D segment に対応付け、頻繁に高コストな VL inference を行う。 - TRACKGRAPH は sparse keyframe でのみ FastSAM と CLIP を計算し、間は dense DINOv3 で mask を伝播するため効率的。 - Replica, ScanNet++, HM3D で state-of-the-art mapping 手法と競合する open-vocabulary segmentation/retrieval 性能。 - 同一 NVIDIA A100 上で ViT-H OVI-MAP より 1.7x 高速、GPU memory 3.3x 削減。 - Replica で synonym frequency 0.50 と最高値を達成。

3. 技術・手法の肝は?

- 画像空間で短期的な 2D mask identity を維持し、その後 3D に fuse する。 - FastSAM masks と CLIP features を sparse keyframe で計算。 - dense DINOv3 features を用いて keyframe 間で mask を高頻度に伝播。 - 追跡された mask を class-agnostic な 3D segment layer に統合し、階層的 scene graph を構築。 - 3D association で tracking の中断や長期的な再訪に対処。 - コンパクトな multi-view CLIP embeddings で open-vocabulary retrieval を実現。

4. どうやって有効だと検証した?

- Replica, ScanNet++, HM3D のデータセットで open-vocabulary segmentation と retrieval を評価。 - state-of-the-art mapping 手法と比較し、競合する性能を確認。 - Replica で synonym frequency 0.50 を達成。 - 同一 NVIDIA A100 上で ViT-H OVI-MAP と速度・GPU memory を比較。 - 実世界の quadruped 展開で onboard scene graph 構築と object search を 7.5Hz で実証。 - 記録された drone データで aerial viewpoints 下でのテストも実施。

5. 議論はある?

- 要旨からは、手法の限界や失敗ケース、議論の詳細は不明。 - 評価は複数データセットと実機で行われているが、定性的な議論は要旨に記載なし。 - 比較対象や評価指標の詳細も要旨からは不明。

6. 次に読むべき論文は?

- ViT-H OVI-MAP(比較対象として明示) - FastSAM(使用手法) - CLIP(使用手法) - DINOv3(使用手法) - Replica, ScanNet++, HM3D(評価データセット) - open-vocabulary 3D scene graph 分野の関連研究(要旨に個別の参照なし)

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Peder Borge Hellesylt, Albert Gassol Puigjaner, Kostas Alexis, Annette Stahl

分類: cs.CV, cs.RO

原文アブストラクト

Open-vocabulary 3D maps enable robots to reason about previously unknown environments using natural language. However, existing systems typically segment every incoming image, associate detections with persistent 3D segments, and frequently perform costly Vision-Language (VL) inference. We present TRACKGRAPH, an online open-vocabulary system that maintains short-term 2D mask identity directly in the image stream before fusing segments into 3D. FastSAM masks and CLIP features are computed at sparse keyframes, while dense DINOv3 features are used to propagate masks at a high rate in between. The resulting tracked masks are fused into a class-agnostic 3D segment layer within a hierarchical scene graph, with 3D association handling tracking interruptions and long-term revisits. Compact multi-view CLIP embeddings enable open-vocabulary retrieval. Across Replica, ScanNet++, and HM3D, TRACKGRAPH achieves competitive open-vocabulary segmentation and retrieval against state-of-the-art mapping methods, including the highest synonym frequency on Replica (0.50). On the same NVIDIA A100, it is 1.7x faster and uses 3.3x less GPU memory than ViT-H OVI-MAP. Real-world quadruped deployments demonstrate onboard scene graph construction and object search at 7.5Hz, while recorded drone data is used to test the method under aerial viewpoints.

関連論文

PR本紙発行元 EmplifAI