Yangkun Zhu
Shanghai AI Laboratory
収録論文 6本 ・ フィジカルAI/ロボット学習
世界モデルVLAsim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- RoboSnap: ワンショット実世界からシミュレーションへのシーン生成による汎用ロボット学習と評価sim2real2026/7/1
単一のRGB画像から物理的に安定し視覚的にも忠実なシミュレーション環境を自動生成するフレームワークを提案し、ロボットの軌道再現やポリシー学習・評価に活用できることを示した。
- ST4VLA: 視覚言語行動モデルのための空間誘導訓練VLA2026/2/1
VLMに空間的な事前知識を組み込む二段階訓練でロボットの行動生成を改善し、SimplerEnvで新たなSOTAを達成した研究。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。