何が起きたか
Xiaomiは2026年2月13日、視覚言語行動(VLA)モデル「Xiaomi-Robotics-0」を発表し、コードとモデルチェックポイントをオープンソースとして公開した。同モデルはリアルタイム実行に最適化され、コンシューマー向けGPUで高速なロールアウトを実現するとしている。
詳細
Xiaomi-Robotics-0は、大規模なクロスエンボディのロボット軌跡データと視覚言語データで事前学習され、基盤となるVLMの視覚意味知識を保持しつつ、汎用的な行動生成能力を獲得する。ポストトレーニングでは、非同期実行のための技術を導入し、推論遅延に対処。デプロイ時には、予測されたアクションチャンクのタイムステップを整列させ、シームレスなリアルタイムロールアウトを実現する。評価では、シミュレーションベンチマークで最先端の性能を達成し、実機の両腕操作タスクでも高い成功率とスループットを示した。
Key Facts
| XiaomiはVLAモデル「Xiaomi-Robotics-0」を発表し、コードとモデルチェックポイントをオープンソース化した。 | [1] |
| 同モデルはリアルタイム実行に最適化され、コンシューマー向けGPUで高速なロールアウトを実現する。 | [1] |
| 事前学習には大規模なクロスエンボディのロボット軌跡データと視覚言語データを使用する。 | [1] |
| ポストトレーニングでは非同期実行のための技術を導入し、推論遅延に対処する。 | [1] |
| シミュレーションベンチマークで最先端の性能を達成し、実機の両腕操作タスクでも高い成功率を示した。 | [1] |
なぜ重要か
XiaomiがロボットAIの基盤モデルをオープンソースで公開したことで、家庭用ロボットの知能化が加速する可能性がある。特に、リアルタイム実行と低コストGPU対応は、実用化へのハードルを下げるものであり、今後の製品展開に影響を与えるとみられる。