Mingcai Zhou
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA模倣学習/視覚運動ポリシーマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- QDepth-VLA:量子化深度予測を補助監督とする視覚-言語-行動モデルVLA2025/10/1
VLAモデルにVQ-VAEで量子化した深度マップの潜在トークンを予測する補助タスクを追加し、空間推論能力とマニピュレーション性能を向上させた。
- VGGT-DP: 視覚基盤モデルによる汎化可能なロボット制御模倣学習/視覚運動ポリシー2025/9/1
3D知覚モデルVGGTを視覚エンコーダに用い、固有感覚フィードバックと組み合わせた視覚運動ポリシーを提案。トークン再利用とランダム枝刈りで推論を高速化し、MetaWorldタスクで高精度・長期的タスクの性能を向上させた。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- 身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイVLA2025/8/1
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。