Zezhong Qian
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- 多段階視覚推論のための階層的デノイジングビデオ生成/推論2026/7/16
因果的ビデオ生成に階層的潜在変数を統合し、粗い推論から細かい推論へと段階的に進めることで、複雑な多段階視覚推論タスクを効率的に解決するフレームワークを提案した。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- WAM-RL: 再構成報酬とオンラインビデオSFTを用いたワールド・アクションモデル強化学習強化学習2026/6/1
ワールドモデルとアクションモデルをオンライン環境相互作用で共同最適化する強化学習フレームワークを提案し、長期的タスクでの性能向上を実証した。
- HarmoWAM: 適応的世界行動モデルによる汎用性と精密操作の調和ロボット制御2026/5/1
世界行動モデル(WAM)の2つのパラダイム間のトレードオフを解消するため、予測と反応の2つの専門家を世界モデルで統合し、適応的ゲーティングで切り替えるエンドツーエンドのWAMを提案した。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成VLA2025/10/1
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。