Haoqi Yuan
Alibaba Inc.
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- 器用なロボット操作のための人間中心の転移可能な触覚事前学習触覚/操作2026/7/1
人間の触覚データを大規模に収集し、ロボット操作のための触覚事前学習手法を提案した論文。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- RealDexUMI: 器用なロボット学習のためのウェアラブル汎用操作インターフェーステレオペレーション/器用操作2026/6/1
手先の細かい操作を保ちつつ実機展開可能なデモ収集を実現するため、共有の器用なエンドエフェクタと掌側同型テレオペ用手袋を備えたウェアラブル操作インターフェースを提案し、8つの実ロボットタスクで平均成功率88.75%を達成した。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデルVLA2026/5/1
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- 後続遷移の再重み付けによる保守的オフラインロボット方策学習オフライン強化学習2026/3/1
ロボットのオフライン事後学習で、各サンプルの行動後の結果に基づいて学習への影響度を再重み付けする手法PTRを提案。不均一なデータセットでの保守的な適応を改善する。
- Joint-Aligned Latent Action: 実世界データからのスケーラブルなVLA事前学習に向けてVLA2026/2/1
人間の操作動画から逆動力学と実行動に整合する潜在行動を学習し、大規模なVLA事前学習を可能にするフレームワークJALAを提案。
- 視覚-言語-行動モデルのスケーリング再考:アラインメント・混合・正則化VLA2026/2/1
VLAモデルのスケーリングを体系的に検証し、エンドエフェクタ相対の行動表現が異なる身体間の転移に重要である一方、異種ロボットデータの単純な混合は負の転移を招くことを示した研究。
- Being-H0.5: 人間中心のロボット学習をスケールさせ、異なる身体間の汎化を実現VLA2026/1/1
人間の動作データを共通言語として扱い、35,000時間超・30種のロボット身体のデータで学習するVLA基盤モデルを提案し、異なる身体間での汎化性能を大幅に向上させた。
- VLAモデルの信頼性指標としての輸送不一致VLA2025/12/1
フローマッチング型VLAモデルにおいて、観測特徴と行動表現間の輸送コストを信頼性指標として利用し、推論時に行動を反復修正する軽量プラグインDiGを提案した論文。
- 人間動画からの視覚-物理アライメントによる空間認識VLA事前学習VLA2025/12/1
人間の動画から3D視覚・動作アノテーションを抽出し、2D視覚と3D空間推論を事前学習で結びつけるVLAモデルを提案。下流のロボットタスクで2D視覚と3D動作の対応が改善し、汎化性能が向上した。
- 実演編集強化学習による汎用巧みな機能把持マニピュレーション2025/12/1
把持スタイルとアフォーダンスを条件として分解し、単一の実演を編集する強化学習で多様な物体の機能把持を学習、シミュレーションから実世界への転移とVLMによる指示追従を実現した。
- UniTacHand:人間からロボットハンドへの触覚スキル転移のための統合時空間触覚表現触覚2025/12/1
触覚グローブで収集した人間の操作データを、MANOハンドモデルの2D表面上でロボットハンドの触覚情報と統合し、コントラスト学習で潜在空間を揃えることで、ゼロショットでの触覚ベース方策転移を実現した研究。
- DemoHLM: 単一のデモンストレーションから汎化可能なヒューマノイド移動操作へ移動操作2025/10/1
シミュレーション上の1回のデモンストレーションから、実機ヒューマノイドの移動を伴う操作タスクを汎化可能に学習する階層型フレームワークを提案し、Unitree G1で10タスクのsim-to-real移行を実証した。
- 固有感覚を考慮した双腕ヒューマノイドロボットの身体性計画に向けてVLA2025/10/1
双腕ヒューマノイド向けの新シミュレータDualTHORを構築し、固有感覚情報を組み込んだProprio-MLLMを提案。既存MLLMより計画性能が平均19.75%向上した。
- DemoGrasp: 単一のデモンストレーションからの万能な器用把持マニピュレーション2025/9/1
1つの把持デモ軌道を編集し、単一ステップMDPとしてRLで最適化することで、多様な物体・手・実世界に汎化する万能な器用把持方策を学習した。
- Being-H0: 大規模人間動画からの視覚-言語-行動事前学習VLA2025/7/1
大規模な人間の動画を活用し、巧みな操作を可能にする視覚-言語-行動モデルを事前学習する手法を提案。物理指示チューニングにより、実世界のロボット操作への転移性能を向上させた。
- DualTHOR: 偶発的失敗を考慮した計画のための双腕ヒューマノイドシミュレーションプラットフォームsim2real2025/6/1
家庭環境で双腕ヒューマノイドロボットが協調作業するための物理シミュレータを構築し、低レベル実行時の偶発的失敗も再現することで、視覚言語モデルのロバスト性を評価できるようにした。
- Being-0: 視覚言語モデルとモジュール型スキルを統合したヒューマノイドロボットエージェントVLA2025/3/1
基盤モデルによる高レベルな指示理解・計画と、モジュール型スキルライブラリによる歩行・マニピュレーションを、軽量VLMのConnectorで橋渡しする階層型エージェントを提案し、実機ヒューマノイドで長期的タスクを実現した。
- 人間のデモンストレーションから多様な両手巧み操作スキルを学習するマニピュレーション2024/10/1
人間の両手操作データセットからタスクを自動構築し、教師-生徒学習で多様な両手巧み操作スキルを視覚ベース方策として学習するフレームワークBiDexHDを提案した。
- ResDex: 混合エキスパートと残差学習による汎用器用把持マニピュレーション2024/10/1
物体ごとに学習した幾何非依存のベース方策を混合エキスパートで組み合わせ、残差行動を学習することで、多様な物体への汎用器用把持を効率的に実現した。
- 強化学習による異なるロボットハンド間で汎用な巧みな把持マニピュレーション2024/10/1
人間の手の固有把持(eigengrasp)に基づく共通行動空間と、指先・手のひらの位置のみに簡略化した観察空間を用いて、単一の視覚ベース方策で複数のロボットハンドを制御する強化学習手法を提案した。
- DMotion: Robotic Visuomotor Control with Unsupervised Forward Model Learned from Videos2021/3/1