Chen-Hsuan Lin
収録論文 8本 ・ フィジカルAI/ロボット学習
動画生成ビデオ生成/拡散蒸留VLA世界モデル3D知覚
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LongLive-Plug: 動画生成のための一度きりの蒸留フレームワーク動画生成2026/9/29
ベースモデルにLoRAとして再利用可能な能力を学習させ、下流モデルに訓練不要でプラグアンドプレイ展開できる蒸留手法を提案。
- Causal-rCM: ストリーミング動画生成と対話型ワールドモデルのための自己回帰拡散蒸留における教師強制と自己強制の統一的オープンレシピビデオ生成/拡散蒸留2026/6/24
自己回帰ビデオ拡散モデルに対して、拡散蒸留フレームワークrCMを拡張し、教師強制と自己強制の相補性を活用した統一的な蒸留手法Causal-rCMを提案。カスタムマスクFlashAttention-2 JVPカーネルにより連続時間CMを実装し、10倍の収束高速化と最先端のストリーミング動画生成性能を達成した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- ViPE: 3D幾何知覚のための動画ポーズ推定エンジン3D知覚2025/8/1
未校正の生動画からカメラ内部パラメータ・運動・密な深度を推定する汎用エンジンViPEを提案し、大規模動画データセットに正確な3Dアノテーションを付与して公開した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- BARF: Bundle-Adjusting Neural Radiance Fields2021/4/1