Jun Guo
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SplineWAM: Bスプライン表現によるワールドアクションモデルの適応的行動ホライズンVLA2026/9/30
行動軌道を3次Bスプラインで圧縮し、動作の複雑さに応じて行動チャンクの時間解像度と長さを適応的に変えるワールドアクションモデルを提案。推論呼び出しを削減しつつ成功率を向上させた。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- Xiaomi-Robotics-U0: 世界基盤モデルによる統合的身体性合成VLA2026/7/1
ロボットの身体性を考慮した画像・動画生成を統合する380億パラメータのマルチモーダル自己回帰モデルを提案し、マルチビュー一貫性やロボットの身体制約を保ちながら、シーン生成や転移、動画生成を高品質で実現した。
- 汎用ロボット操作のための身体化チェーン・オブ・ソートの再考VLA2026/6/1
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
- MyoChallenge 2025: 人間の運動知能のための新しいベンチマーク運動制御2026/5/1
NeurIPS 2025で開催されたMyoChallengeは、高忠実度の筋骨格モデルと物理シミュレーションを用いて、卓球ラリーとサッカーペナルティキックの2つのタスクで運動制御の知能を競うベンチマークを確立した。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- 非同期ノイズ除去によるビデオ事前学習を活用した統合4D世界行動モデリングVLA/世界モデル2026/4/1
ロボットのリアルタイム行動実行と高忠実度な4D世界生成(ビデオ+3D再構成)を単一フレームワークで統合するX-WAMを提案し、非同期ノイズサンプリングにより行動効率と生成品質を両立した。
- Diff-Muscle: 筋骨格ロボット卓球のための効率的学習筋骨格ロボット/強化学習2026/3/1
筋骨格ロボットの制御を、微分平坦性を用いて冗長な筋活性化空間から低次元の関節空間へ再定式化し、階層的強化学習により卓球ラリーを実現する手法を提案した。
- Xiaomi-Robotics-0:リアルタイム実行可能なオープンソース視覚言語行動モデルVLA2026/2/1
大規模なロボット軌道と視覚言語データで事前学習し、非同期実行のための学習技術と展開時のタイムステップ調整により、民生用GPUで高速かつ滑らかなリアルタイム動作を実現したVLAモデルを提案。
- あらゆる外乱下であらゆる動作を追従するヒューマノイド動作トラッカーsim2real2025/9/1
二段階強化学習フレームワークAny2Trackを提案し、単一ポリシーで多様な動作を追従しつつ、地形・外力・物性変化などの外乱にオンライン適応して実機でゼロショットsim2realを実現した。
- FlowDreamer: フローベースの動作表現を用いたロボットマニピュレーションのためのRGB-Dワールドモデルワールドモデル2025/5/1
3Dシーンフローを明示的な動作表現として用い、U-Netと拡散モデルを組み合わせてロボット操作のためのRGB-Dワールドモデルを構築し、映像予測と視覚計画タスクで性能を向上させた。