Zhongyi Zhou
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- dWorldEval: 離散拡散ワールドモデルによるスケーラブルなロボットポリシー評価評価/ワールドモデル2026/4/1
ロボットポリシーを数千環境・数千タスクで評価するため、視覚・言語・行動を統一トークン空間に写像し、単一のTransformerベースの離散拡散ワールドモデルを評価プロキシとして用いる手法を提案。
- Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化VLA/ポストトレーニング2026/4/1
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
- ActiveUMI: ロボット不要の人間デモンストレーションによる能動的知覚を伴うロボットマニピュレーションマニピュレーション2025/10/1
VRテレオペレーションキットとセンサ付きコントローラで人間の両手作業デモを収集し、頭部運動による能動的知覚も学習してロボットに転移するデータ収集フレームワークを提案。6つの両手タスクで平均70%の成功率を達成。
- ChatVLA-2: 事前学習知識を活かしたオープンワールド身体推論を備える視覚-言語-行動モデルVLA2025/5/1
VLMの能力を保持しつつロボット行動に変換するMoE型VLAモデルを提案し、ホワイトボードの数式を読んでカードを選ぶ課題などで数学・OCR・空間推論能力を示した。
- ObjectVLA: 実演なしで実世界の物体操作を実現するエンドツーエンドVLAVLA2025/2/1
Vision-Language-Actionモデルを用い、新規物体に対する実演データなしでロボットの物体操作スキルを汎化させる手法を提案し、実機で100種類の未見物体に対し64%の成功率を達成した。
- ChatVLA:視覚・言語・行動モデルによるマルチモーダル理解とロボット制御の統合VLA2025/2/1
視覚言語行動モデルにおける「忘却」と「タスク干渉」を解決するため、段階的アライメント訓練とMixture-of-Expertsを組み合わせたChatVLAを提案し、マルチモーダル理解と実ロボット操作の両方で高性能を実現した。
- Diffusion-VLA: 自己生成推論による汎用性と解釈性を備えたロボット基盤モデルVLA2024/12/1
自己回帰モデルと拡散モデルを組み合わせ、自己生成した推論を方策学習に注入することで、解釈性が高く汎用性のある視覚運動方策を実現したロボット基盤モデル。
- RoCap: 外観変化物体の姿勢推定のためのロボットデータ収集パイプラインデータ収集2024/7/1
ロボットアームで対象物体を様々な6D姿勢で動かし、関節角度から正解姿勢を自動計算して学習データを収集するパイプラインを提案。ぬいぐるみや透明・反射・関節物体など外観が変化する物体の姿勢推定モデルを効率的に訓練できる。