UniPart: 実世界インタラクションのためのゼロショット言語接地3Dパーツセグメンテーション
UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction
自由なテキスト指示から点群上の機能パーツを切り出すクロスモーダル3D Transformerを提案し、大規模データセット構築によりゼロショット性能と実機把持への転移を実現した。
詳しい要約
1. どんなもの?
2. 先行研究と比べてどこがすごい?
3. 技術・手法の肝は?
4. どうやって有効だと検証した?
5. 議論はある?
6. 次に読むべき論文は?
※ AIが要旨から生成した要約です。正確性は原文をご確認ください。
著者: Xinqiang Yu, Zekun qi, Jiawei He, Wenyao Zhang, Xuchuan Chen, Guaocai Yao, Li Yi, Zhaoxiang Zhang, He Wang
分類: cs.CV, cs.AI, cs.RO
原文アブストラクト
Fine-grained robotic manipulation depends on understanding parts, not only whole objects. Existing 3D foundation models tend to be either generalized but object-aware, or part-aware but limited to closed-set taxonomies, which weakens zero-shot transfer. We study text-conditioned 3D part segmentation, where a free-form phrase selects a functional part on point cloud. We introduce UniPart, a feed-forward cross-modal 3D Transformer that conditions CLIP text embedding. To scale supervision, we build LangPart-1M with 160K+ Objaverse assets and 8M text to part pairs using multi-view consistent part generation. We further manually label a high-quality subset, LangPart-4K, for fine-tuning and evaluation. UniPart achieves strong zero-shot results on open-vocabulary part benchmarks and transfers to language-conditioned part grasping in real world.
関連論文
- 仮想ドローンを飛ばして3Dガウシアンをオンラインでセグメンテーション3Dセグメンテーション
- EPS3D: エンドツーエンドのフィードフォワード型3Dパノプティックセグメンテーション3Dセグメンテーション
- T-FunS3D: タスク駆動型階層的オープンボキャブラリ3D機能セグメンテーション3Dセグメンテーション
- TrackRef3D: 3Dガウススプラッティングにおけるオープンワールド参照セグメンテーションのための多視点一貫トラック・アンド・ラベル手法3Dセグメンテーション
- FoundObj: 自己教師あり基盤モデルを報酬として用いたラベル不要の3Dオブジェクトセグメンテーション3Dセグメンテーション
- Clutt3R-Seg: 散乱シーンでの言語指示把持のためのスパースビュー3Dインスタンスセグメンテーション3Dセグメンテーション