Yin Cui
収録論文 6本 ・ フィジカルAI/ロボット学習
画像編集VLAsim2real世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 何を編集できるのか?オープンエンドな戦略発見と感情編集可能性のランドスケープ画像編集2026/7/27
感情画像編集を「どう編集するか」ではなく「何を編集できるか」と捉え直し、画像固有の編集可能領域を発見するマルチエージェントフレームワークEmoScopeを提案。大規模な人間評価で既存手法を上回る性能を示した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- SAGE: 身体性AIのためのスケーラブルなエージェント型3Dシーン生成sim2real2026/2/1
ユーザーが指定した身体性タスクを理解し、複数の生成器と評価器を組み合わせて物理的に妥当でシミュレータ対応の3D環境を自動生成するエージェントフレームワークを提案。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- Cosmos-Reason1:物理的常識から身体性推論へVLA2025/3/1
物理世界を理解し、長い思考連鎖を通じて自然言語で身体的行動決定を生成するマルチモーダル大規模言語モデルCosmos-Reason1を提案し、物理的常識と身体性推論のベンチマークで評価した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。