Gordon Wetzstein
収録論文 7本 ・ フィジカルAI/ロボット学習
世界モデルベンチマークビデオ生成VLAsim2real模倣学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- BAgger: 自己回帰ビデオ拡散モデルのドリフトを後方集約で軽減ビデオ生成2025/12/12
自己回帰ビデオ拡散モデルの誤差蓄積による品質ドリフトを、モデル自身のロールアウトから修正軌道を構築する自己教師あり学習で軽減する手法を提案。
- CoT-VLA:視覚的思考連鎖推論を用いた視覚-言語-行動モデルVLA2025/3/1
将来の画像フレームを視覚的目標として自己回帰的に予測してから行動系列を生成することで、視覚的思考連鎖推論をVLAに組み込み、実世界タスクで17%の性能向上を達成した。
- 操作インターフェースとしてのフロー:Im2Flow2Actsim2real2024/7/1
物体の動き(フロー)を人間とロボットの共通インターフェースとして使い、人間の動画とシミュレーションのロボットデータだけで実世界の多様な操作スキルを獲得する学習フレームワーク。
- HumanPlus:ヒューマノイドの人間動作模倣とシャドーイング模倣学習2024/6/1
人間の動作データセットとRGBカメラによるリアルタイムシャドーイングを組み合わせ、ヒューマノイドが自律的に多様なタスクを模倣学習できるフルスタックシステムを構築した。
- State of the Art on Diffusion Models for Visual Computing2023/10/11