Ye Wang
Renmin University of China
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TAO-DA: 自律操作に向けた双腕協調マニピュレーションのためのデュアルアーム視覚言語行動モデルVLA2026/9/27
共有VLMバックボーンに腕ごとに分離したエキスパート塔を組み合わせ、言語指示と視覚意味による二段階の意図ルーティングで双腕の干渉を解消するVLAモデルを提案。タスク進捗予測モジュールで協調スケジューリングも可能にした。
- TAO-Force: 接触の多いマニピュレーションのための力認識知覚と高速・低速制御の統合VLA2026/9/16
力フィードバックを視覚言語モデルに注入し、接触時のみ高速なアドミタンス制御に切り替える枠組みを提案し、接触の多い操作タスクでの有効性を示した。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- HRIBench:相互作用中心の人間ロボット協調のベンチマークHRI/ベンチマーク2026/7/1
人間とロボットの協調作業を評価するための新しいベンチマークを提案し、役割や時間的依存関係を明示したシナリオに基づいて、指示者・協力者・割り込み者の3つの役割を定義し、既存のVLAモデルが協調タスクで苦戦することを示した。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- ReCoVLA: VLMガイドによる報酬生成で視覚言語行動ポリシーの障害回復を実現VLA/障害回復2026/6/8
事前学習済みのVLAポリシーを凍結し、外部VLMで障害モードと回復段階を推定して報酬を構成することで、シミュレーションでの残差ポリシー訓練と実機へのゼロショット転送を行う障害回復フレームワークを提案した。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- 完全な筋肉の進化:筋骨格系移動のための効率的な形態-制御共設計筋骨格ロボット/共設計/進化計算2026/4/1
筋骨格ロボットの形態と制御を同時に最適化する手法を提案し、PCAと対称性を利用した低次元進化により、複雑な地形での移動性能を向上させた。
- ICPRL: インタラクティブ制御から物理的直感を獲得する物理推論2026/3/1
視覚言語モデルが動的物理環境での対話的推論を強化するため、複数エピソードの相互作用履歴から方策を適応させるICRLフレームワークを導入し、世界モデルと組み合わせて物理パズルを解く。
- 形態情報をTransformerに埋め込むクロスロボット方策学習VLA2026/3/1
ロボットの関節構造やトポロジーをTransformerに組み込み、複数の機体にまたがって動作する方策を学習する手法を提案した論文。
- 視覚-言語-行動モデルのスケーリング再考:アラインメント・混合・正則化VLA2026/2/1
VLAモデルのスケーリングを体系的に検証し、エンドエフェクタ相対の行動表現が異なる身体間の転移に重要である一方、異種ロボットデータの単純な混合は負の転移を招くことを示した研究。
- EasyMimic:人間の動画からロボット模倣学習を低コストで実現するフレームワーク模倣学習2026/2/1
家庭用低コストロボットが、RGBカメラで撮影した人間の動画から3D手軌跡を抽出し、把持制御空間にマッピングして模倣学習する手法を提案。少量のロボットデータとの共同学習で新タスクに迅速適応し、高コストなデータ収集を削減する。
- Joint-Aligned Latent Action: 実世界データからのスケーラブルなVLA事前学習に向けてVLA2026/2/1
人間の操作動画から逆動力学と実行動に整合する潜在行動を学習し、大規模なVLA事前学習を可能にするフレームワークJALAを提案。
- Being-H0.5: 人間中心のロボット学習をスケールさせ、異なる身体間の汎化を実現VLA2026/1/1
人間の動作データを共通言語として扱い、35,000時間超・30種のロボット身体のデータで学習するVLA基盤モデルを提案し、異なる身体間での汎化性能を大幅に向上させた。
- VLAモデルの信頼性指標としての輸送不一致VLA2025/12/1
フローマッチング型VLAモデルにおいて、観測特徴と行動表現間の輸送コストを信頼性指標として利用し、推論時に行動を反復修正する軽量プラグインDiGを提案した論文。
- 人間動画からの視覚-物理アライメントによる空間認識VLA事前学習VLA2025/12/1
人間の動画から3D視覚・動作アノテーションを抽出し、2D視覚と3D空間推論を事前学習で結びつけるVLAモデルを提案。下流のロボットタスクで2D視覚と3D動作の対応が改善し、汎化性能が向上した。
- DemoGrasp: 単一のデモンストレーションからの万能な器用把持マニピュレーション2025/9/1
1つの把持デモ軌道を編集し、単一ステップMDPとしてRLで最適化することで、多様な物体・手・実世界に汎化する万能な器用把持方策を学習した。
- PlaneHEC: 任意の点群平面検出による多視点ロボットアームの効率的ハンドアイキャリブレーションキャリブレーション2025/7/1
壁や机などの任意の平面を深度カメラで検出するだけで、複雑なモデルや人手を要さずに多視点ロボットアームのハンドアイキャリブレーションを高精度かつ高速に行う手法を提案。
- Being-H0: 大規模人間動画からの視覚-言語-行動事前学習VLA2025/7/1
大規模な人間の動画を活用し、巧みな操作を可能にする視覚-言語-行動モデルを事前学習する手法を提案。物理指示チューニングにより、実世界のロボット操作への転移性能を向上させた。
- QuadrupedGPT:オープンエンド環境で活躍する万能四足ロボットエージェント歩行2024/6/1
大規模マルチモーダルモデルを活用し、人間の指示を理解して歩行とナビゲーションを統合しながら長期目標を分解・実行する四足ロボットエージェントを提案した。
- Data-driven Predictive Tracking Control based on Koopman Operators2022/8/1