Enshen Zhou
Beihang University
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveArena:ロボットマニピュレーションにおける能動的知覚のベンチマークと理解VLA2026/9/21
能動的知覚と操作を評価するためのシミュレータと35タスクのベンチマーク、および13種のVLA構成を提案し、記憶管理やOOD汎化の要因を分析した。
- MA-VLA: 協調と構成的汎化のためのマルチアーム視覚言語行動モデルVLA2026/8/26
複数アームの協調動作をアトミックな行動割り当てで分解し、訓練時にアームの役割をシャッフルすることで、未見の協調パターンへの汎化を実現するVLAモデルを提案した。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現VLA/能動的知覚/操作2026/3/1
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論VLA2025/10/1
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
- RoboOS-NeXT:生涯学習・スケーラブル・堅牢なマルチロボット協調のための統合メモリフレームワーク群制御2025/10/1
空間・時間・身体性を統合した共有メモリSTEMを中核に、脳-小脳型の階層構造で異種ロボット群の生涯学習・動的タスク割当・障害復旧を実現するフレームワークを提案。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出VLA2024/12/1
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。