何が起きたか
小米は7月15日、具身智能向けの統一生成モデル「Xiaomi-Robotics-U0」を正式に発表し、オープンソース化した。同モデルは380億パラメータを持ち、具身シーン生成、具身転移、ロボットインタラクション動画生成、汎用文生図・画像編集の4種類のタスクを1つのモデルで処理する。WorldArenaベンチマークでは総合1位を獲得し、真機テストではタスク完了率が平均26.3%向上した。
詳細
小米は7月15日、具身智能向けの統一生成モデル「Xiaomi-Robotics-U0」(以下U0)を正式に発表し、オープンソース化した。U0は380億パラメータを持ち、具身シーン生成、具身転移、ロボットインタラクション動画生成、汎用文生図・画像編集の4種類のタスクを1つのモデルで処理する。これまでこれらのタスクは異なるモデルで処理されていたが、U0はそれらを統一した。 U0は五維解耦の制御方式を採用し、ワークスペースのレイアウト、前景の操作物体、前景の無関係な物体、照明条件、背景情報の5つの次元に分けて、自然言語で独立に制御できる。これにより、変更したい変数だけを調整し、他の構造や軌跡情報を保持できる。また、FlashAR+推論加速スキームを導入し、1024×1024解像度での単一サンプル生成時間を450.77秒から5.44秒に短縮し、生成効率を約82.9倍向上させた。 真機テストでは、U0で拡張したデータで訓練したロボットは、未知の照明や未知の背景などのOOD(分布外)シーンでタスク完了率が平均26.3%向上した。また、WorldArenaベンチマークでは、U0は匿名コード「UNIS」で参加し、2026年7月15日時点で126モデル中総合1位を獲得し、指示追従、インタラクション品質、視点一貫性の3つのサブ項目でも1位となった。GPT-Image-2.0との比較では、U0は深度一貫性、構造保存、意味整合の3つの次元で大幅にリードした。
Key Facts
| 小米は7月15日、具身智能向けの統一生成モデル「Xiaomi-Robotics-U0」を正式に発表し、オープンソース化した。 | [1] |
| U0は380億パラメータを持ち、具身シーン生成、具身転移、ロボットインタラクション動画生成、汎用文生図・画像編集の4種類のタスクを1つのモデルで処理する。 | [1] |
| U0は五維解耦の制御方式を採用し、ワークスペースのレイアウト、前景の操作物体、前景の無関係な物体、照明条件、背景情報の5つの次元を自然言語で独立に制御できる。 | [0] |
| U0はFlashAR+推論加速スキームを導入し、1024×1024解像度での単一サンプル生成時間を450.77秒から5.44秒に短縮し、生成効率を約82.9倍向上させた。 | [0] |
| 真機テストでは、U0で拡張したデータで訓練したロボットは、未知の照明や未知の背景などのOODシーンでタスク完了率が平均26.3%向上した。 | [0] |
| WorldArenaベンチマークでは、U0は匿名コード「UNIS」で参加し、2026年7月15日時点で126モデル中総合1位を獲得し、指示追従、インタラクション品質、視点一貫性の3つのサブ項目でも1位となった。 | [0] |
| GPT-Image-2.0との比較では、U0は深度一貫性、構造保存、意味整合の3つの次元で大幅にリードした。 | [1] |
| U0のコードとモデル重みは全面オープンソース化され、プロジェクトページとコードリポジトリが公開されている。 | [1] |
なぜ重要か
U0は、具身智能分野で初めて統一生成モデルを実現し、データ生成の効率とコストを大幅に改善した。これにより、ロボット訓練データの大規模生産が可能となり、ロボットの汎化能力向上と実用化への道を開く。