日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
3DセグメンテーションarXiv:2609.12898

UniPart: 実世界インタラクションのためのゼロショット言語接地3Dパーツセグメンテーション

UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction

シェア:XThreadsFacebookLINEはてブBluesky

自由なテキスト指示から点群上の機能パーツを切り出すクロスモーダル3D Transformerを提案し、大規模データセット構築によりゼロショット性能と実機把持への転移を実現した。

詳しい要約

1. どんなもの?

- テキスト条件付き3Dパートセグメンテーションの研究 - 自由記述のフレーズでpoint cloud上の機能的なpartを選択 - UniPart: CLIP text embeddingを条件とするfeed-forward cross-modal 3D Transformer - LangPart-1M: 160K+ Objaverse assetsと8M text-to-part pairsのデータセット - LangPart-4K: 手動ラベル付き高品質サブセット - 実世界のlanguage-conditioned part graspingへ転移

2. 先行研究と比べてどこがすごい?

- 既存の3D foundation modelsは汎用だがobject-aware、またはpart-awareだがclosed-set taxonomiesに限定 - そのためzero-shot転移が弱い - UniPartはopen-vocabularyなpart segmentationで強いzero-shot結果 - 実世界のlanguage-conditioned graspingへ転移可能

3. 技術・手法の肝は?

- feed-forward cross-modal 3D Transformer - CLIP text embeddingを条件付け - multi-view consistent part generationによりLangPart-1Mを構築 - LangPart-4Kでfine-tuningと評価

4. どうやって有効だと検証した?

- open-vocabulary part benchmarksで強いzero-shot結果 - 実世界のlanguage-conditioned part graspingへの転移を確認 - 詳細な評価プロトコルは要旨からは不明

5. 議論はある?

- 要旨からは不明

6. 次に読むべき論文は?

- CLIP - Objaverse - 3D foundation models - open-vocabulary part segmentation - language-conditioned grasping

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xinqiang Yu, Zekun qi, Jiawei He, Wenyao Zhang, Xuchuan Chen, Guaocai Yao, Li Yi, Zhaoxiang Zhang, He Wang

分類: cs.CV, cs.AI, cs.RO

原文アブストラクト

Fine-grained robotic manipulation depends on understanding parts, not only whole objects. Existing 3D foundation models tend to be either generalized but object-aware, or part-aware but limited to closed-set taxonomies, which weakens zero-shot transfer. We study text-conditioned 3D part segmentation, where a free-form phrase selects a functional part on point cloud. We introduce UniPart, a feed-forward cross-modal 3D Transformer that conditions CLIP text embedding. To scale supervision, we build LangPart-1M with 160K+ Objaverse assets and 8M text to part pairs using multi-view consistent part generation. We further manually label a high-quality subset, LangPart-4K, for fine-tuning and evaluation. UniPart achieves strong zero-shot results on open-vocabulary part benchmarks and transfers to language-conditioned part grasping in real world.

関連論文