Haoyang Li
Alibaba Inc.
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 相互作用中心モデリングによる2本指グリッパ操作の統一的クロスドメイン表現の実現マニピュレーション2026/9/25
2本指グリッパの共通構造をパラメータ化した抽象化で捉え、VLMとSAMで相互作用 triplet を推定し、Flow-Matching Transformerで7自由度動作を生成することで、異なるロボット間や視点間でのゼロショットsim-to-real転移を可能にした模倣学習手法。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- PDSジョイント:器用な手に特化したパラメトリック二重螺旋ジョイントハンド/コンプライアントジョイント2026/6/1
本論文は、器用な手のためのパラメトリック二重螺旋(PDS)コンプライアントジョイントを提案し、方向依存の剛性を調整可能にし、埋め込み型誘導センサと学習ベースのキャリブレーションにより関節状態推定を実現した。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- 密な身体化チェーン・オブ・ソート監視による視覚言語行動モデルの訓練VLA2026/6/1
ロボット間の転移を改善するため、視覚言語モデルに密な身体化チェーン・オブ・ソート(ECoT)監視を導入し、推論時にはECoT生成をスキップできるデュアルストリームアーキテクチャのVLAモデルZR-0を提案した。
- ピクセルからトークンへ:視覚言語行動モデルにおける潜在行動教師あり学習の体系的研究VLA2026/5/1
視覚言語行動モデル(VLA)の学習における潜在行動の教師あり手法を体系的に比較し、画像ベースと行動ベースの潜在行動がそれぞれ長期的推論と複雑な運動制御に有効であることを示した。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- ProcVLM: 手順に基づく進捗報酬を学習するロボット操作モデルマニピュレーション2026/5/1
長期的なロボット操作タスクにおいて、手順の構造と視覚変化に基づいて進捗を推定し、密な報酬信号を生成する視覚言語モデルProcVLMを提案した。
- UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ強化学習/システムアーキテクチャ2026/5/1
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
- HierKick: 視覚誘導サッカーロボット制御のための階層的強化学習階層的強化学習2026/3/1
サッカーロボット制御のための二周波数階層型強化学習フレームワークを提案し、高レベル方策で戦術選択、低レベル制御で精密な関節動作を実現。シミュレーションと実機で高い成功率を達成した。
- アクション草案と検証:視覚言語行動モデルのための自己検証フレームワークVLA2026/3/1
拡散アクション専門家が複数のアクション候補を生成し、VLMが一回のフォワードパスでスコアリングして最適なものを選択する自己検証フレームワークを提案。シミュレーションと実世界で成功率を向上させた。
- 階層的マニピュレーション政策のための世界モデルのスケーリングVLA2026/2/1
大規模事前学習済み世界モデルを高レベルプランナーとして用い、VLAを低レベル実行者とする階層的フレームワークを提案。未知物体や新規状況での汎化性能を大幅に向上させた。
- PhysMem: 身体性物理推論のためのテスト時メモリのスケーリングVLA2026/2/1
VLMロボットプランナがテスト時に経験から物理法則を学び、仮説を検証してから適用するメモリフレームワークを提案。実世界の操作タスクで成功率が大幅に向上。
- FocusNav: ウェイポイント誘導による空間選択的注意を用いたヒューマノイドのローカルナビゲーション歩行2026/1/1
ヒューマノイドロボットのローカルナビゲーションにおいて、ウェイポイント誘導の空間クロスアテンションと安定性に応じた選択的ゲーティングで知覚を適応制御し、動的環境での衝突回避と安定歩行を実現した。
- 視覚プロンプトを用いた視覚-言語-行動モデルによるオフロード自動運転VLA2026/1/1
オフロード自動運転向けに、セマンティックセグメンテーションを視覚プロンプトとして使い自己整合性付き思考連鎖で推論するVLAフレームワークOFF-EMMAを提案し、軌道計画精度を改善した。
- オフロード自動運転の進展:大規模ORAD-3Dデータセットと包括的ベンチマーク自律走行データセット2025/10/1
オフロード自動運転向けの大規模データセットORAD-3Dを構築し、知覚・計画に関する5つのタスクのベンチマークを整備した論文。
- 歩みを止めず:選択的敵対的訓練による頑健なヒューマノイド運動スキルの学習歩行2025/7/1
脆弱な状態と行動を選択的に攻撃する敵対的訓練手法を提案し、ヒューマノイドの長期運動・全身体制御の頑健性を向上させた。
- 適応型支援カリキュラム力によるヒューマノイドロボットの運動スキル学習歩行2025/6/1
乳幼児やアスリートが外部サポートを利用する仕組みに着想を得て、支援力エージェントが状態依存の力を加えながら徐々に支援を減らす二重エージェント強化学習手法A2CFを提案し、二足歩行・ダンス・バク宙の学習を高速化・高成功率化した。
- ロボット視覚指示:手描きシンボルによるロボット操作の新パラダイムVLA2025/5/1
手描きの矢印や丸などの2Dシンボルでロボットに3D操作を指示するRoVIを提案し、VLMで解釈して行動に変換するVIEWを実現した。
- 布操作のための生成的状态推定を伴う拡散ダイナミクスモデル変形物体操作2025/3/1
拡散モデルを用いて布の状態推定とダイナミクス予測を行い、モデル予測制御と組み合わせて実機で布折り畳みを実現した研究。