Yunze Man
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA表現学習3Dシーン理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- 視覚環境構造の捉え方が制御性能と相関する表現学習2026/2/1
事前学習済み視覚エンコーダが環境状態(幾何・物体構造・物理属性)をどれだけデコードできるかを測ることで、下流のロボット制御性能を予測できることを示した研究。
- Fast-ThinkAct: 言語化可能な潜在プランニングによる効率的な視覚-言語-行動推論VLA2026/1/1
推論トレースを潜在的な思考連鎖に蒸留し、推論VLAの推論遅延を最大89.3%削減しつつ長期的プランニングや適応性能を維持する手法を提案。
- Lexicon3D: 複雑な3Dシーン理解のための視覚基盤モデルを探る3Dシーン理解2024/9/1
画像・動画・3Dの視覚基盤モデル7種を4つの3Dシーン理解タスクで比較評価し、各モデルの強みと弱みを明らかにした研究。
- DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception2023/5/1
- Multi-Modality Task Cascade for 3D Object Detection2021/7/1
- Graph Neural Networks for 3D Multi-Object Tracking2020/8/1