Mengzhen Liu
Beijing Academy of Artificial Intelligence
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveArena:ロボットマニピュレーションにおける能動的知覚のベンチマークと理解VLA2026/9/21
能動的知覚と操作を評価するためのシミュレータと35タスクのベンチマーク、および13種のVLA構成を提案し、記憶管理やOOD汎化の要因を分析した。
- SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現VLA/能動的知覚/操作2026/3/1
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- MotionTrans: 人間のVRデータでロボットマニピュレーション方策の動作レベル学習を実現マニピュレーション2025/9/1
VRで収集した人間の動作データを変換し、ロボットデータと重み付き共訓練することで、13タスクの動作をエンドツーエンド方策へ直接転移。9タスクはゼロショットで成功し、事前学習・微調整性能も40%向上。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- CordViP: 実世界での巧みな操作のための対応関係に基づく視覚運動ポリシーマニピュレーション2025/2/1
物体の6D姿勢推定とロボット固有感覚を活用し、物体と手の対応関係を捉えるインタラクション認識点群を構築することで、実世界の巧みな操作を高精度に実現する視覚運動ポリシーを提案した。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。