Jiannan Xiang
収録論文 6本 ・ フィジカルAI/ロボット学習
世界モデルVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- PAN: 汎用的で対話可能な長期的世界シミュレーションのための世界モデル世界モデル2025/11/12
LLMベースの潜在ダイナミクスと動画拡散デコーダを組み合わせ、言語で指定した行動に応じて多様な環境の未来を長期的にシミュレーションする世界モデルPANを提案。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。