Chenming Zhu
The University of Hong Kong
収録論文 7本 ・ フィジカルAI/ロボット学習
評価ベンチマークVLA3Dシーン理解LiDARセグメンテーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚品質を超えて:自己運動下の物理的整合性を評価するEgoGenEval評価ベンチマーク2026/9/10
自己運動下での視覚生成モデルの物理的整合性を評価するポーズ不要のベンチマークEgoGenEvalを提案し、16モデルの評価とSFT実験からペアワイズ教師強制目的の限界を示した。
- ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデルVLA2025/12/1
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- MMScan: 階層的接地言語アノテーション付きマルチモーダル3Dシーンデータセット3Dシーン理解2024/6/1
領域から物体レベルまでの階層的な言語アノテーションを備えた大規模マルチモーダル3Dシーンデータセットを構築し、3D視覚接地と質問応答のベンチマークを提供した。
- 最先端LiDARセグメンテーションモデル訓練の実証研究LiDARセグメンテーション2024/5/1
LiDARセグメンテーション研究を統一するツールボックスMMDetection3D-lidarsegを提案し、多様なモデル・データ拡張・疎畳み込みバックエンドを統合してベンチマークを効率化した。
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- MV-FCOS3D++: Multi-View Camera-Only 4D Object Detection with Pretrained Monocular Backbones2022/7/1