Ming-Yu Liu
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Causal-rCM: ストリーミング動画生成と対話型ワールドモデルのための自己回帰拡散蒸留における教師強制と自己強制の統一的オープンレシピビデオ生成/拡散蒸留2026/6/24
自己回帰ビデオ拡散モデルに対して、拡散蒸留フレームワークrCMを拡張し、教師強制と自己強制の相補性を活用した統一的な蒸留手法Causal-rCMを提案。カスタムマスクFlashAttention-2 JVPカーネルにより連続時間CMを実装し、10倍の収束高速化と最先端のストリーミング動画生成性能を達成した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- PhysisForcing: ロボット操作のための物理強化ワールドシミュレータビデオ生成/物理シミュレーション2026/6/1
ビデオ生成モデルをロボット操作の世界シミュレータとして使う際に、物理的に不自然な動きが生じる問題を解決するため、物理的に重要な領域に注目した学習フレームワークを提案した。
- SC3-Eval: 自己整合的なビデオ生成によるロボット基盤モデルの評価評価2026/6/1
ロボット操作ポリシーの実世界評価を、アクション条件付きビデオ世界モデルを用いてスケーラブルに代替する手法を提案。前方・逆方向ダイナミクス整合性、クロスビュー整合性、テスト時整合性の3つの整合性を課すことで、正確なポリシー評価を実現する。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- SAGE: 身体性AIのためのスケーラブルなエージェント型3Dシーン生成sim2real2026/2/1
ユーザーが指定した身体性タスクを理解し、複数の生成器と評価器を組み合わせて物理的に妥当でシミュレータ対応の3D環境を自動生成するエージェントフレームワークを提案。
- Cosmos Policy: 視覚運動制御と計画のための動画モデル微調整VLA2026/1/1
大規模事前学習済み動画モデルを、アーキテクチャ変更なしの一段階の追加学習だけでロボット方策に変換し、行動・将来画像・価値を潜在フレームとして生成して計画も可能にした手法。
- PointWorld: 実世界ロボット操作のための3D世界モデルのスケーリングマニピュレーション2026/1/1
RGB-D画像とロボットの行動コマンドから3D点群の動きを予測する大規模事前学習済み3D世界モデルを提案し、実機ロボットのモデル予測制御に応用した。
- Openpi Comet:2025 BEHAVIORチャレンジ競技解法マニピュレーション2025/12/1
2025 BEHAVIORチャレンジに向けた解法を提案し、事前学習と事後学習のスケーリング効果を明らかにして、検証Qスコア0.345を達成した。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- ビデオ世界モデルによるスケーラブルな方策評価世界モデル2025/11/1
行動条件付き動画生成モデルを世界モデルとして用い、ロボットマニピュレーション方策の実機評価を代替するスケーラブルな評価手法を提案した。
- Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し自動運転/VLA2025/11/1
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- CoT-VLA:視覚的思考連鎖推論を用いた視覚-言語-行動モデルVLA2025/3/1
将来の画像フレームを視覚的目標として自己回帰的に予測してから行動系列を生成することで、視覚的思考連鎖推論をVLAに組み込み、実世界タスクで17%の性能向上を達成した。
- Cosmos-Transfer1:適応的マルチモーダル制御による条件付きワールド生成sim2real2025/3/1
セグメンテーション・深度・エッジなど複数モダリティの空間制御入力を場所ごとに重み付けして世界シミュレーションを生成するモデルを提案し、ロボティクスのSim2Realや自動運転データ拡張への応用とリアルタイム推論を実証した。
- Cosmos-Reason1:物理的常識から身体性推論へVLA2025/3/1
物理世界を理解し、長い思考連鎖を通じて自然言語で身体的行動決定を生成するマルチモーダル大規模言語モデルCosmos-Reason1を提案し、物理的常識と身体性推論のベンチマークで評価した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- ワンステップ拡散方策:拡散蒸留による高速視覚運動方策VLA2024/10/1
事前学習済み拡散方策を蒸留して1ステップで行動を生成する手法を提案し、推論速度を1.5Hzから62Hzへと大幅に高速化した。
- Learning to Remove Multipath Distortions in Time-of-Flight Range Images for a Robotic Arm Setup2016/1/1