Kaiwen Zheng
収録論文 4本 ・ フィジカルAI/ロボット学習
感情認識ビデオ生成/拡散蒸留VLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 本当に1Bパラメータ超のマルチモーダル感情言語モデルが必要なのか?感情認識2026/7/14
大規模マルチモーダル感情認識モデルは高性能だが計算コストが高い。本論文では、知識蒸留により軽量なサブ10億パラメータの学生モデルに知識を転移し、効率的で高性能な感情認識を実現するLight-MERを提案する。
- Causal-rCM: ストリーミング動画生成と対話型ワールドモデルのための自己回帰拡散蒸留における教師強制と自己強制の統一的オープンレシピビデオ生成/拡散蒸留2026/6/24
自己回帰ビデオ拡散モデルに対して、拡散蒸留フレームワークrCMを拡張し、教師強制と自己強制の相補性を活用した統一的な蒸留手法Causal-rCMを提案。カスタムマスクFlashAttention-2 JVPカーネルにより連続時間CMを実装し、10倍の収束高速化と最先端のストリーミング動画生成性能を達成した。
- Vidarc: 閉ループ制御のための身体性ビデオ拡散モデルVLA2025/12/1
マスク付き逆動力学モデルを組み合わせた自己回帰的な身体性ビデオ拡散モデルにより、低遅延で高精度なロボットアームの閉ループ制御を実現した研究。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。