Wenkang Qin
収録論文 8本 ・ フィジカルAI/ロボット学習
sim2realVLA占有知覚
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Uranus: 身体性AIのための次世代シミュレーション基盤の構築sim2real2026/9/21
関節軌道条件付き自己回帰拡散モデルを用いたデータ駆動型ロボットシミュレータUranusを提案し、ストリーミング生成、低遅延、多様なロボット制御に対応した。
- GigaWorld-0:世界モデルをデータエンジンとして具現化AIを強化VLA2025/11/1
視覚・言語・行動(VLA)学習のためのデータ生成エンジンとして、動画生成と3D生成を統合した世界モデルフレームワークを提案し、実世界データなしでロボットの汎化性能とタスク成功率を向上させた。
- GigaBrain-0: ワールドモデルを活用した視覚-言語-行動モデルVLA2025/10/1
ワールドモデルで生成した多様なデータを活用し、実機データへの依存を抑えつつ汎化性能を高めたVLA基盤モデルを提案。RGBD入力と身体性Chain-of-Thoughtで長期的・移動を伴う器用な操作タスクの実世界性能を向上させた。
- EMMA: 生成的視覚転送による実世界ロボットマニピュレーションの汎化VLA2025/9/1
拡散Transformerでロボット操作動画を生成し、実データと混合してVLAポリシーを訓練することで、未知の視覚環境へのゼロショット汎化を実現した。
- MimicDreamer: 人間とロボットのデモンストレーションを統合しスケーラブルなVLA学習を実現VLA2025/9/1
人間の操作動画をロボット視点・動作に変換する映像拡散モデルと視点安定化・動作整合技術を組み合わせ、実機ロボットでの少数ショット実行を可能にするVLA学習フレームワークを提案。
- ヒューマノイド占有:汎用マルチモーダル占有知覚システムの実現占有知覚2025/7/1
ヒューマノイドロボット向けに、マルチモーダル融合と時系列統合を用いた占有グリッド知覚システムを構築し、専用のパノラマ占有データセットを整備した。
- EmbodiedGen: 身体性知能のための生成的3D世界エンジンsim2real2025/6/1
物理的リアリティと正確なスケールを持つ3Dアセットを低コストで生成し、物理シミュレーションに直接インポート可能な基盤プラットフォームを提案。
- ReconDreamer: オンライン修復による走行シーン再構成のための世界モデル構築sim2real2024/11/1
世界モデルの知識を段階的に統合し、オンライン修復でアーティファクトを抑えることで、車線変更などの大規模な操作を含む走行シーンを高品質に再構成する手法を提案。