Chenhao Qiu
Fudan University
収録論文 3本 ・ フィジカルAI/ロボット学習
VLAVLA/世界モデルVLA/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留するVLA2026/8/1
大規模ビデオ基盤モデルの拡散事前知識を、コンパクトな世界行動モデル(WAM)に蒸留するフレームワークを提案。専門家デモに依存せず、タスク条件付き未来予測と逆動力学モデルによる擬似行動を活用し、限られたデモでも新規タスクへの汎化とデータ効率を向上させる。
- τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデルVLA/世界モデル2026/6/1
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
- OFlow: 物体認識を組み込んだ時間的フローマッチングによる堅牢なロボット操作VLA/操作2026/4/1
ロボット操作のためのVLAモデルに、物体認識を組み込んだ時間的フローマッチングを導入し、将来予測と物体認識を統一した潜在空間で行うことで、分布シフト下での堅牢性を向上させた。