Carl Vondrick
収録論文 17本 ・ フィジカルAI/ロボット学習
操作視覚推論VLA水中マニピュレーションsim2real新規視点合成マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 細部にこだわるロボット批評家操作2026/6/1
ロボット操作の成功と失敗を細かく見分ける批評家を、成功・失敗ロールアウトからペアの進捗監視で微調整し、候補行動の選択精度を向上させた。
- マルチモーダルモデルは電気羊を想像するのか?視覚推論2026/5/10
空間パズルを解く際に大規模マルチモーダルモデルが心的イメージを形成することを発見し、そのイメージを利用して推論性能を向上させる手法を提案した論文。
- 動画生成器はロボットポリシーであるVLA2025/8/1
動画生成をロボットポリシー学習の代理として用いる「Video Policy」を提案し、少ない実演データで未知の物体・背景・タスクへの汎化性能とサンプル効率を大幅に向上させた。
- 自己改善型の自律水中マニピュレーション水中マニピュレーション2024/10/1
人間のデモからの行動クローニングと自己学習最適化を組み合わせ、水中で物体把持・ゴミ分別・救助回収を自律遂行し、人間の遠隔操作より41%高速化したシステムAquaBotを開発した。
- 微分可能ロボットレンダリングsim2real2024/10/1
ロボットの見た目を制御パラメータで微分可能に描画する手法を提案し、画像からの姿勢復元や視覚言語モデルによる制御に応用した。
- Dreamitate: 動画生成による実世界視覚運動ポリシー学習VLA2024/6/1
動画拡散モデルを人間の実演で微調整し、新しい場面の画像から生成した実行動画でロボットを直接制御することで、既存の行動クローニングより高い汎化性能を実現した。
- 生成的カメラドリー:単眼動的シーンの極端な新規視点合成新規視点合成2024/5/1
単一視点の動画から任意のカメラ視点の同期動画を生成する拡散モデルベースの手法を提案し、ロボティクスや運転環境などでのゼロショット汎化を示した。
- PaperBot:紙で実世界の道具を設計する学習マニピュレーション2024/3/1
紙を折る・切る・投げる動作を自己教師あり学習で最適化し、紙飛行機や紙グリッパーを実機ロボットで設計・使用する手法を提案。
- SHIFT3D: Synthesizing Hard Inputs For Tricking 3D Detectors2023/9/1
- Tracking through Containers and Occluders in the Wild2023/5/1
- Zero-1-to-3: Zero-shot One Image to 3D Object2023/3/1
- FLEX: Full-Body Grasping Without Full-Body Grasps2022/11/1
- Full-Body Visual Self-Modeling of Robot Morphologies2021/11/1
- The Boombox: Visual Reconstruction from Acoustic Vibrations2021/5/1
- Analogical Reasoning for Visually Grounded Language Acquisition2020/7/1
- Visual Hide and Seek2019/10/1
- Tracking Emerges by Colorizing Videos2018/6/1