Erjin Zhou
収録論文 6本 ・ フィジカルAI/ロボット学習
sim2realVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- QuadVerse: 四足歩行シミュレーションのための視覚と物理の現実を統合するフレームワークsim2real2026/6/1
RGB動画から再構成した3Dシーンを基盤に、視覚・接触・アクチュエータの各ギャップを統合的に補正し、実機データなしで視覚ナビゲーションをゼロショット展開できる四足歩行シミュレーションフレームワークを提案した。
- ジェスチャー対応視覚言語行動モデルGesVLA:埋め込み表現による操作精度の向上VLA2026/5/1
テキスト指示だけでは曖昧な空間指示を解決するため、ジェスチャーを並列指示として取り入れ、潜在空間に直接エンコードする視覚言語行動モデルGesVLAを提案した。実世界のロボット操作タスクで、複雑な環境での目標把握精度と対話効率が向上することを示した。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価VLA2025/10/1
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
- MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶VLA2025/8/1
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。