Yunhong Wang
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚言語行動ポリシーのためのアドバンテージ誘導事後学習の分解VLA2026/9/23
視覚言語行動ポリシーの事後学習において、アドバンテージ誘導強化学習の設計選択を分解し、段階的評価で有効なモジュール式レシピを特定した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- Xiaomi-Robotics-U0: 世界基盤モデルによる統合的身体性合成VLA2026/7/1
ロボットの身体性を考慮した画像・動画生成を統合する380億パラメータのマルチモーダル自己回帰モデルを提案し、マルチビュー一貫性やロボットの身体制約を保ちながら、シーン生成や転移、動画生成を高品質で実現した。
- Xiaomi-Robotics-0:リアルタイム実行可能なオープンソース視覚言語行動モデルVLA2026/2/1
大規模なロボット軌道と視覚言語データで事前学習し、非同期実行のための学習技術と展開時のタイムステップ調整により、民生用GPUで高速かつ滑らかなリアルタイム動作を実現したVLAモデルを提案。
- デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェントVLA2026/1/1
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
- MSGNav: マルチモーダル3Dシーングラフによるゼロショット身体性ナビゲーションナビゲーション2025/11/1
視覚情報を画像のまま保持するマルチモーダル3Dシーングラフを構築し、ゼロショットで物体探索ナビゲーションを行うシステムを提案。GOAT-BenchとHM3D-ObjNavで最高性能を達成。
- PolySim: マルチシミュレータのダイナミクスランダム化によるヒューマノイド制御のsim-to-realギャップの橋渡しsim2real2025/10/1
複数の異なるシミュレータを同時に用いて全身制御ポリシーを訓練し、シミュレータ固有のバイアスを低減して実機へのゼロショット転移を実現した。
- EmboMatrix: 身体性意思決定のためのスケーラブルな訓練基盤VLA2025/10/1
大規模言語モデルに身体性意思決定能力を獲得させるため、タスク・シーン生成、分散シミュレーション、精密報酬を統合した訓練基盤EmboMatrixを構築し、7Bモデルが671Bモデルを上回る性能を達成した。