Xianzheng Ma
収録論文 3本 ・ フィジカルAI/ロボット学習
3D視覚言語理解VLA3D-LLM
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 3D大規模言語モデルは本当に3D空間関係を理解しているのか?3D視覚言語理解2026/3/1
既存の3D-LLMがテキストの手がかりに頼っており、3D空間理解を正しく評価できていない問題を指摘し、より厳密なベンチマークReal-3DQAと3D視覚情報を活用する学習手法を提案した。
- ロボット視覚指示:手描きシンボルによるロボット操作の新パラダイムVLA2025/5/1
手描きの矢印や丸などの2Dシンボルでロボットに3D操作を指示するRoVIを提案し、VLMで解釈して行動に変換するVIEWを実現した。
- LLMが3D世界へ:マルチモーダル大規模言語モデルによる3Dタスクのサーベイとメタ分析3D-LLM2024/5/1
LLMを3D空間データに統合する3D-LLMの研究を、点群からNeRFまでの表現、シーン理解・対話・ナビゲーションなどのタスク、課題と将来展望まで体系的に整理したサーベイ。