Yuan Zhang
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Magic-W0:物理知能のための構造化ワールド・アクション基盤モデルVLA2026/9/30
ロボットの行動生成と環境の物理的状態変化を、現在状態・遷移・未来状態からなる構造化表現で同時にモデル化する基盤モデルを提案。大規模データで事前学習し、行動仮説と世界予測を層レベルで相互に作用させる。
- ZimaBlue: スケーラブルなビデオ事前学習による汎化可能な世界行動モデルの進化VLA2026/8/31
大規模な一人称視点ビデオからロボット制御のための世界行動モデルを学習するフレームワークを提案し、実機ゼロショット評価で成功率を大幅に向上させた。
- LabDex: 実験室における器用な操作のための階層的ベンチマークマニピュレーション2026/8/19
化学実験室での器用な操作を評価するための大規模な実世界データセットとベンチマークを導入し、原子スキル、合成タスク、長期実験の階層的タスク分類を提供する。
- ReTouch: オンライン更新型触覚予測による接触豊富な器用操作の実現触覚/操作2026/8/1
触覚予測を実行時のフィードバックでオンライン更新するVLAモデルReTouchを提案し、接触を伴う器用操作の成功率を大幅に向上させた。
- iFLYTEK-Embodied-Omni技術報告VLA2026/6/24
視覚・言語・行動を単一のOmniフレームワークで統合したマルチモーダル基盤モデルを提案し、脳と小脳の協調に例えられる設計で、指示理解から行動生成までを一貫して行う。
- GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習VLA/操作2026/6/7
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
- 汎用ロボット操作のための身体化チェーン・オブ・ソートの再考VLA2026/6/1
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
- DanceHMR: 単眼ビデオからの手を含む全身人体メッシュ復元全身復元2026/5/18
単眼ビデオから全身の動きと手の詳細を安定して復元する新しいフレームワークを提案。
- JoyAI-Image: 統一マルチモーダル理解と生成における空間知能の覚醒VLA2026/5/5
視覚理解・テキストからの画像生成・指示による画像編集を統合したマルチモーダル基盤モデルを提案し、空間認識能力を強化した。
- 身体が動く前に:言語条件付きヒューマノイド制御のための予測的関節意図の学習ヒューマノイド制御2026/5/1
言語指示に基づくヒューマノイドの全身制御において、将来の接触変化やバランス準備を明示的に予測する階層的フレームワークDAJIを提案し、予測的関節意図を学習することで追従性能と生成品質を向上させた。
- 非同期ノイズ除去によるビデオ事前学習を活用した統合4D世界行動モデリングVLA/世界モデル2026/4/1
ロボットのリアルタイム行動実行と高忠実度な4D世界生成(ビデオ+3D再構成)を単一フレームワークで統合するX-WAMを提案し、非同期ノイズサンプリングにより行動効率と生成品質を両立した。
- Xiaomi-Robotics-0:リアルタイム実行可能なオープンソース視覚言語行動モデルVLA2026/2/1
大規模なロボット軌道と視覚言語データで事前学習し、非同期実行のための学習技術と展開時のタイムステップ調整により、民生用GPUで高速かつ滑らかなリアルタイム動作を実現したVLAモデルを提案。
- iFlyBot-VLA 技術報告VLA2025/11/1
人間とロボットの大規模操作動画で学習した潜在行動モデルと、二段階の行動表現でVLMと行動エキスパートを同時に訓練する新しいVLAフレームワークを提案し、LIBEROベンチマークと実機で有効性を示した。
- iFlyBot-VLM 技術報告VLA2025/11/1
視覚と言語を統合し、ロボットの知覚と動作制御をつなぐ汎用VLMを提案。10のベンチマークで最高性能を達成し、データと重みを公開予定。
- Fast ECoT: 思考の再利用による効率的な身体性Chain-of-Thought推論VLA2025/6/1
VLAモデルの身体性Chain-of-Thought推論を、高レベル推論のキャッシュ・再利用とモジュール推論の並列生成により高速化し、学習不要でリアルタイム動作に近づけた手法。
- MoLe-VLA: レイヤ混合による動的レイヤスキップ型視覚言語行動モデルVLA2025/3/1
LLMの各層をエキスパートとみなし、ロボットの状態に応じて必要な層だけを動的に活性化する視覚言語行動モデルを提案し、計算コストを抑えつつ操作タスクの性能を維持した。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
- Open-Nav: オープンソースLLMによる連続環境でのゼロショット視覚言語ナビゲーションの探求VLA2024/9/1
オープンソースLLMを使い、連続環境でのゼロショット視覚言語ナビゲーションを実現するOpen-Navを提案。時空間Chain-of-Thought推論と詳細な物体・空間知識でシーン認識を強化し、閉源LLMに匹敵する性能を示した。
- ロボット制御のための潜在線形二次レギュレータ制御2024/7/1
状態空間を潜在空間に写像し、そこで線形ダイナミクスと二次コスト関数を学習することで、LQRを効率的に適用する手法を提案。
- 平滑化対数バリア関数を用いた制約付き強化学習制約付き強化学習2024/3/21
安全性クリティックに対数バリア関数を平滑化して適用し、事前学習なしで制約付き制御タスクを高精度に解く強化学習手法CSAC-LBを提案し、実機四足歩行ロボットでも検証した。
- Learning Continuous Control with Geometric Regularity from Robot Intrinsic Symmetry2023/6/1
- Incorporating Recurrent Reinforcement Learning into Model Predictive Control for Adaptive Control in Autonomous Driving2023/1/1