Haoyu Zhen
UMass Amherst
収録論文 6本 ・ フィジカルAI/ロボット学習
ワールドモデル/シミュレーションマニピュレーションVLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SyncWorld: 視覚キャリブレーションによるワールドモデルのゼロショットシミュレータ化ワールドモデル/シミュレーション2026/9/8
ロボットの行動と視覚変化の対応を視覚キャリブレーションで文脈的に指定することで、未見環境でも追加学習なしに行動結果を正確にシミュレートできるワールドモデルを提案した。
- GHOST: ロボット操作の汎化を実現する階層的サブゴールポリシーマニピュレーション2026/6/8
多視点RGB-D観測から3Dエンドエフェクタのポーズを予測する高レベルポリシーと、その目標を達成する低レベルコントローラを組み合わせた階層的枠組みを提案し、操作タスクの汎化性能を向上させた。
- アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習VLA2026/4/1
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
- TesserAct: 4D身体化世界モデルの学習世界モデル2025/4/1
RGB-DN動画を生成するビデオモデルを微調整し、身体化エージェントの行動に応じた4Dシーン予測を可能にする世界モデルを提案。
- 3D-VLA:3D視覚・言語・行動の生成的ワールドモデルVLA2024/3/1
3D知覚・推論・行動を生成的ワールドモデルで結びつけた基盤モデルを提案し、拡散モデルによる将来の画像・点群生成を通じて行動計画能力を向上させた。
- 3D-LLM: Injecting the 3D World into Large Language Models2023/7/1