Yating Wang
Shanghai AI Laboratory
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0-Δ: 予測ダイナミクスと行動を橋渡しする20K時間超のオープンデータによるワールドアクションモデルVLA2026/9/25
視覚ダイナミクスと行動生成を統合したワールドアクションモデルを、20,000時間超の異種オープンデータで事前学習し、シミュレーションと実機で従来手法を上回る性能を達成した。
- MetaWorld: 単一視点ビデオデータからのマルチエージェントビデオワールドモデルのスケーリングビデオ生成2026/6/1
単一視点のビデオから、複数エージェントが共有する3D空間で一貫したビデオを生成するマルチエージェントビデオワールドモデルを提案した。カメラ軌跡分解とクロスアテンションによる世界状態整合で、データ不足と視点間の整合性問題を解決する。
- GAE:VLMの物理的ポテンシャルを引き出す汎用アクションエキスパートVLA2025/10/1
VLMが予測した疎な3Dウェイポイントを、汎用アクションエキスパートが密なロボット動作に変換する手法を提案。大規模点群-軌道データで事前学習し、下流タスクへの汎化性能を実現した。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- VQ-VLA:ベクトル量子化アクショントークナイザのスケーリングによる視覚-言語-行動モデルの改善VLA2025/7/1
大規模な行動軌跡データセットで学習したベクトル量子化アクショントークナイザを提案し、ゼロショットで多様なロボットタスクに適応可能で、長期的タスクの成功率を最大30%向上させた。
- CoMo: インターネット動画から連続潜在運動を学習するスケーラブルなロボット学習VLA2025/5/1
インターネット動画から連続的な潜在運動表現を教師なしで学習し、未知動画へのゼロショット汎化と擬似行動ラベル生成を可能にする手法CoMoを提案。
- Tra-MoE: 複数ドメインからの軌道予測モデル学習による適応的ポリシー条件付けVLA2024/11/1
スパースMoEアーキテクチャで任意点軌道を予測し、適応的ポリシー条件付けでロボット制御を改善する手法を提案。
- SPA: 3D空間認識による効果的な身体性表現学習身体性表現学習2024/10/1
多視点画像への微分可能レンダリングでViTに3D空間理解を持たせ、8シミュレータ268タスクで既存手法を上回る身体性表現学習フレームワークを提案。
- 点群が鍵:ロボット学習における観測空間の影響の再考マニピュレーション2024/2/1
RGB・RGB-D・点群という3つの観測モダリティがロボット学習に与える影響を、2つのシミュレータと125タスクからなるベンチマークOBSBenchで比較し、点群ベースの手法が接触の多い操作タスクで優れた性能と汎化を示すことを明らかにした。