Pavel Tokmakov
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboDream: スケーラブルなロボットデータ合成のための構成的世界モデルデータ生成/世界モデル2026/6/1
ロボット学習のための大規模データ生成を実現する、エンボディメント中心の世界モデルを提案。実ロボットの動作をレンダリングし、シーンや物体の事前知識を条件付けすることで、物理的に実現可能なフォトリアリスティックなデモを合成し、データスケーリングを可能にする。
- 細部にこだわるロボット批評家操作2026/6/1
ロボット操作の成功と失敗を細かく見分ける批評家を、成功・失敗ロールアウトからペアの進捗監視で微調整し、候補行動の選択精度を向上させた。
- 視覚環境構造の捉え方が制御性能と相関する表現学習2026/2/1
事前学習済み視覚エンコーダが環境状態(幾何・物体構造・物理属性)をどれだけデコードできるかを測ることで、下流のロボット制御性能を予測できることを示した研究。
- AnyView: 動的シーンにおける任意の新規視点を合成動的視点合成2026/1/1
拡散モデルベースの動画生成フレームワークで、動的な実世界シーンにおいて任意のカメラ視点からの時空間的に一貫した新規動画を生成する。
- AnchorDream: 動画拡散モデルを活用した身体性を考慮したロボットデータ合成データ合成/拡散モデル2025/12/1
ロボットの動作レンダリングを条件に事前学習済み動画拡散モデルを再利用し、身体性の一貫性を保ちながら多様なロボット実演データを合成する手法を提案。
- 動画生成器はロボットポリシーであるVLA2025/8/1
動画生成をロボットポリシー学習の代理として用いる「Video Policy」を提案し、少ない実演データで未知の物体・背景・タスクへの汎化性能とサンプル効率を大幅に向上させた。
- マルチタスク巧みな操作のための大規模行動モデルの慎重な検証マニピュレーション2025/7/1
大規模行動モデル(LBM)をシミュレーションと実世界で厳密に評価し、マルチタスク事前学習が単一タスクより成功率・堅牢性・データ効率を高めることを統計的に示した。
- Dreamitate: 動画生成による実世界視覚運動ポリシー学習VLA2024/6/1
動画拡散モデルを人間の実演で微調整し、新しい場面の画像から生成した実行動画でロボットを直接制御することで、既存の行動クローニングより高い汎化性能を実現した。
- 生成的カメラドリー:単眼動的シーンの極端な新規視点合成新規視点合成2024/5/1
単一視点の動画から任意のカメラ視点の同期動画を生成する拡散モデルベースの手法を提案し、ロボティクスや運転環境などでのゼロショット汎化を示した。
- Understanding Video Transformers via Universal Concept Discovery2024/1/1
- Tracking through Containers and Occluders in the Wild2023/5/1
- Zero-1-to-3: Zero-shot One Image to 3D Object2023/3/1
- Standing Between Past and Future: Spatio-Temporal Modeling for Multi-Camera 3D Multi-Object Tracking2023/2/1
- Heterogeneous-Agent Trajectory Forecasting Incorporating Class Uncertainty2021/4/1