日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
3D視覚的グラウンディングarXiv:2608.30451

SeqAlign3DVG: シーケンス整合ベンチマークとボクセル推論フレームワークによる3D視覚的グラウンディング

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

シェア:XThreadsFacebookLINEはてブBluesky

時間順序と観測整合性を備えた画像ベース3D視覚的グラウンディングの新しいベンチマークと、ボクセルメモリと段階的融合を用いた推論フレームワークを提案した。

詳しい要約

1. どんなもの?

SeqAlign3DVGは、時間順序と厳密な観測整合性を持つ画像ベースの3D Visual Groundingのための新しいベンチマークと、それを解くためのvoxelベースの推論フレームワークを提案する研究。ベンチマークは9,622の単一視点サンプルと14,493のシーケンスサンプルからなり、人間が検証した表現が提供されたRGB観測(単一フレームまたは順序付けられた観測シーケンス)に厳密に基づいている。また、提案手法はRelevance-Ordered Voxel Memory (ROVM)とProgressive Language-Voxel Fusion (PLVF)からなる統一パイプラインで、複雑な関係や外観手がかりで定義されたターゲットの位置特定を改善する。

2. 先行研究と比べてどこがすごい?

既存のベンチマークはテキストと観測の対応が緩く、時間的順序を無視しているのに対し、SeqAlign3DVGは時間順序と厳密な観測整合性を保証する点が新しい。また、従来のorder-agnostic viewsやglobal point cloudsを用いる手法とは異なり、提供されたRGB観測に厳密に基づく表現を用いる。提案フレームワークは、depth-freeプロトコル下で最先端の性能を達成し、複雑な関係や外観手がかりで定義されたターゲットの位置特定を大幅に改善する。

3. 技術・手法の肝は?

手法の肝は、voxelベースの統一パイプラインと、ROVMとPLVFの2つのモジュール。ROVMは、保守的なメモリを用いて多視点の証拠を動的にランク付けし集約することで、ノイズの多い観測を軽減する。PLVFは、粗密の空間言語推論を行い、正確な曖昧性解消を実現する。これにより、時間順序と観測整合性を考慮した推論が可能になる。

4. どうやって有効だと検証した?

提案手法をSeqAlign3DVGベンチマークで評価し、depth-freeプロトコル下でstate-of-the-artの性能を達成したことを示している。特に、複雑な関係や外観手がかりで定義されたターゲットの位置特定精度が大幅に向上した。具体的な数値や比較対象は要旨からは不明。

5. 議論はある?

要旨からは、提案ベンチマークの表現が人間により検証されている点や、時間順序と観測整合性の重要性が議論されている。また、提案手法がノイズの多い観測を軽減するための保守的なメモリ設計や、粗密の推論による曖昧性解消の有効性が示唆されている。しかし、限界や将来の課題については要旨に明記されていない。

6. 次に読むべき論文は?

要旨で参照されている先行研究は明示されていないが、3D Visual Groundingの分野では、既存のベンチマークや手法(例:ScanRefer、ReferIt3D、3DVG-Transformerなど)が関連する。また、voxelベースの手法や多視点融合に関する研究も関連する。具体的な論文名は要旨にないため、同分野の定番を一般名で挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

分類: cs.CV

原文アブストラクト

Image-based 3D visual grounding is critical for embodied agents, yet existing benchmarks suffer from loose text-observation alignment and neglect temporal ordering. We introduce SeqAlign3DVG, a novel benchmark dedicated to temporally ordered and strictly observation-aligned image-based 3D visual grounding. Unlike prior works using order-agnostic views or global point clouds, SeqAlign3DVG ensures all expressions are human-verified and strictly grounded in the provided RGB observations (single frames or ordered observation sequences). It comprises 9,622 single-view and 14,493 sequence samples featuring rich descriptions, complex relations, and multi-instance ambiguities. To tackle this benchmark, we propose a unified voxel-based pipeline featuring Relevance-Ordered Voxel Memory (ROVM) and Progressive Language-Voxel Fusion (PLVF). ROVM dynamically ranks and aggregates multi-view evidence via a conservative memory to mitigate noisy observations, while PLVF performs coarse-to-fine spatial-linguistic reasoning for precise disambiguation. Our approach achieves state-of-the-art performance under the depth-free protocol, significantly improving localization for targets defined by complex relations and appearance cues.