Xiaokang Yang
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SocialHumanoid: ワンステップ発話同期動作生成による表情豊かなヒューマノイド行動発話同期動作生成2026/9/27
発話に同期した感情表現豊かな全身動作をワンステップで生成し、ヒューマノイドロボット上でリアルタイムに実行するシステムを提案。
- M²Tok: 視覚言語行動モデルのためのマルチヘッド・マルチコードブック離散行動トークン化VLA2026/9/16
連続的な行動信号を複数のヘッドと独立したコードブックで離散トークン化し、再構成誤差を抑えつつVLAモデルの性能を向上させる手法を提案。
- NeoWorld-Pro: 単眼画像から対話型シーンをプログラミングし具現化シミュレーションを実現シーン再構成2026/8/25
単眼RGB画像を、物理特性や関節構造を持つ対話型3Dシーンとして再構成するフレームワークを提案。MLLMによるコード生成と物理エンジンでの検証を組み合わせ、安定した積み重ねや細かい操作などの複雑なタスクを可能にした。
- VT-MUSE: 操作のためのマルチモーダル統合シーケンシャル視触覚表現学習視触覚表現学習2026/8/21
視覚と触覚の時系列情報を統合する表現学習フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を大幅に向上させた。
- Enfold: 世界モデルの想像力を予測表現に折り畳み、超効率的な身体制御を実現VLA2026/7/1
生成モデルが未来を構築する過程で得られる中間計算を、現在の視覚と言語指示のみから予測される表現に転移させる手法を提案。推論時に生成器を実行せずに行動予測が可能となり、遅延を大幅削減。
- V2P-Manip: 単眼人間ビデオからの器用操作学習器用操作2026/6/15
単眼の人間デモビデオから、視覚的忠実度と物理的妥当性を両立した軌道を抽出し、器用な操作ポリシーを直接学習するフレームワークを提案。3Dアセット取得、軌道推定、ポリシー学習を統合し、二段階の精緻化で空間整合性と物理一貫性を確保する。
- AHA-WAM:非同期・地平線適応型ワールドアクションモデルと観測誘導コンテキストルーティング操作学習2026/6/8
世界予測と行動実行を異なる時間解像度で行う非同期ワールドアクションモデルを提案し、ロボット操作タスクで性能を向上させた。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- dVLA-RL: 離散拡散ビジョン・ランゲージ・アクションモデルに対する軌跡上の強化学習VLA/強化学習2026/6/1
離散拡散型VLAモデルの強化学習を可能にするため、生成過程をマルコフ決定過程とみなし、軌跡の結合確率を目的関数とする手法を提案した。
- SynManDex: 合成人間プレグラスプからの人間らしい器用な把持の合成器用な把持/シミュレーション2026/6/1
人間のプレグラスプを生成し、それをロボットハンドにリターゲットして力閉ループ接触を最適化することで、人間らしく安定した器用な把持を合成するパイプラインを提案。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- OrbiSim: 具身知能のための微分可能物理エンジンとしてのワールドモデルシミュレーション2026/5/1
ワールドモデルを完全微分可能な物理エンジンとして再定義し、シミュレーション全体を微分可能にすることで、接触モデリングやスパース報酬下での勾配ベースのポリシー最適化を可能にした。
- LASER: 連続場再構成のための能動センシング学習能動センシング2026/4/21
固定センサ配置に依存せず、物理場の状態に応じてセンサを動かす能動センシングを強化学習で実現し、疎な観測から高精度に場を再構成する手法を提案した。
- Rein3D: パノラマビデオ拡散モデルによる強化学習型3D屋内シーン生成3Dシーン生成2026/4/12
3Dガウススプラッティングとビデオ拡散モデルを組み合わせ、疎な入力から360度の一貫した3D屋内シーンを復元・生成するフレームワークを提案した。
- R3DP: 実時間3D認識ポリシーによる身体的操作マニピュレーション2026/3/1
大規模3D視覚モデルの強力な事前知識を、非同期の高速・低速協調モジュールと軽量な時間特徴予測ネットワークで統合し、実時間性能を保ちながら操作ポリシーの成功率を向上させる手法を提案した。
- 受動的観察者から能動的批評家へ:強化学習がロボット操作のプロセス推論を引き出すマニピュレーション2026/3/1
ビデオMLLMを受動的な観察者から能動的な批評家へと変えるため、結果ベースの強化学習を用いてプロセス推論を誘発する7BフレームワークPRIMO R1を提案し、長期的ロボット操作の進捗監視性能を大幅に向上させた。
- UniVTAC: 視触覚マニピュレーションのデータ生成・学習・評価を統合するシミュレーションプラットフォーム視触覚/マニピュレーション2026/2/1
3種類の視触覚センサに対応したシミュレーション基盤で接触データを大量生成し、視触覚エンコーダと8タスクのベンチマークを提供して、触覚駆動型マニピュレーションの学習と評価を可能にした。
- CLOT: 全身ヒューマノイド遠隔操作のための閉ループ大域モーショントラッキング遠隔操作2026/2/1
高頻度の自己位置推定フィードバックにより、全身ヒューマノイド遠隔操作における大域的な姿勢ドリフトを解消する閉ループ追従システムを提案し、実機で高精度・高ロバストな動作を実現した。
- SingingBot:アバター駆動型ロボット顔歌パフォーマンスシステムロボット顔表情2026/1/1
人間の歌唱アバターを生成し、その表情をロボット顔にマッピングすることで、感情豊かで口パク同期したロボット歌唱を実現するフレームワークを提案。
- MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデルVLA2025/12/1
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
- 専門性は独占する必要なし:視覚-言語-行動学習のための行動特化型Mixture of ExpertsVLA2025/10/1
事前学習済みVLAモデルの重みを継承し、フィードフォワード層をスパースなMoE層に置き換えて拡張するAdaMoEを提案。専門家選択と重み付けを分離することで協調的な専門家利用を実現し、計算効率を保ちつつ性能を向上させた。
- FieldGen: 遠隔操作の前操作軌道からフィールド誘導データ生成へデータ生成2025/10/1
操作を前操作段階と精密操作段階に分け、人間の実演から引力場を構築して多様な軌道を自動生成することで、少ない人手で高品質な実世界データを収集する枠組みを提案。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- 対称性同変強化学習による協調的なヒューマノイドロボットの歩行制御歩行2025/8/1
ヒューマノイドロボットの強化学習に左右対称性を組み込み、アクターに同変性、クリティックに不変性を持たせることで、時空間的に協調した歩行を実現し速度追従精度を最大40%向上させた。
- 歩みを止めず:選択的敵対的訓練による頑健なヒューマノイド運動スキルの学習歩行2025/7/1
脆弱な状態と行動を選択的に攻撃する敵対的訓練手法を提案し、ヒューマノイドの長期運動・全身体制御の頑健性を向上させた。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- 動画で強化するオフライン強化学習:モデルベースアプローチオフライン強化学習2025/5/1
ラベルなし動画から世界モデルを構築し、そのモデルベースの行動ガイダンスでオフライン強化学習の性能を大幅に向上させる手法を提案。
- AutoBio:デジタル生物学実験室におけるロボット自動化のためのシミュレーションとベンチマークsim2real2025/5/1
生物学実験室でのロボット自動化を評価するためのシミュレーションフレームワークとベンチマークAutoBioを提案し、言語誘導型マニピュレーションの課題を明らかにした。
- ActiveAD: 計画指向の能動学習によるエンドツーエンド自動運転能動学習2024/3/1
エンドツーエンド自動運転のデータ効率を高めるため、計画経路の多様性と有用性に基づいてアノテーション対象を選ぶ能動学習手法を提案し、nuScenesの30%データで最先端性能を達成した。
- Model-Based Reinforcement Learning with Multi-Task Offline Pretraining2023/6/1
- Model-Based Reinforcement Learning with Isolated Imaginations2023/3/1
- Iso-Dream: Isolating and Leveraging Noncontrollable Visual Dynamics in World Models2022/5/1
- A GNSS Aided Initial Alignment Method for MEMS-IMU Based on Backtracking Algorithm and Backward Filtering2022/2/1