何が起きたか
NVIDIAは2026年6月1日、物理AI向けのオムニモーダル世界モデル「Cosmos 3」を発表した。同モデルは言語、画像、動画、音声、行動シーケンスを統合的に処理・生成する。評価では、理解・生成タスクで新たな最高水準を達成し、オープンソースのテキストから画像、画像から動画モデルとして最良とされた。
詳細
Cosmos 3は、統一されたmixture-of-transformersアーキテクチャを採用し、言語、画像、動画、音声、行動シーケンスを柔軟な入出力構成で処理する。これにより、視覚言語モデル、動画生成、世界シミュレーター、世界行動モデルを単一フレームワークに統合する。評価では、理解・生成タスクで新たな最高水準を達成し、オープンソースのテキストから画像、画像から動画モデルとして最良とされた。また、ロボットポリシー評価ベンチマークRoboArenaで最良のポリシーモデルとされた。コード、モデルチェックポイント、合成データセット、評価ベンチマークはLinux FoundationのOpenMDW-1.1ライセンスで公開される。
Key Facts
| NVIDIAは2026年6月1日、オムニモーダル世界モデル「Cosmos 3」を発表した。 | [1] |
| Cosmos 3は、言語、画像、動画、音声、行動シーケンスを統合処理するmixture-of-transformersアーキテクチャを採用している。 | [1] |
| 評価では、理解・生成タスクで新たな最高水準を達成し、オープンソースのテキストから画像、画像から動画モデルとして最良とされた。 | [1] |
| ロボットポリシー評価ベンチマークRoboArenaで最良のポリシーモデルとされた。 | [1] |
| コード、モデルチェックポイント、合成データセット、評価ベンチマークはLinux FoundationのOpenMDW-1.1ライセンスで公開される。 | [1] |
本紙の見方
今回のCosmos 3発表は、NVIDIAが物理AI分野で基盤モデルの統合を進める戦略の一環とみられる。従来、視覚言語モデル、動画生成、世界シミュレーター、世界行動モデルは別々に開発されてきたが、Cosmos 3はこれらを単一のアーキテクチャに統合した点が新しい。これは、ロボットや自動運転などの具現化エージェントが、認識から計画、行動までを一貫して学習・推論できることを目指すものだ。 本紙の過去報道では、NVIDIAが推論シフトやエッジAI、ヒューマノイド開発などで存在感を強めていることが報じられている。特に、LGとの二足歩行ヒューマノイド共同開発では、NVIDIA Isaac GR00T基盤モデルとJetson Thorを搭載するとされており、Cosmos 3はこうした基盤モデルの進化を支える可能性がある。また、ロボット学習のパラダイムシフトとして動画基盤モデルを活用する動きが報じられたが、Cosmos 3は動画生成と行動生成を統合することで、この流れをさらに推し進めるものだ。 業界構造への含意として、Cosmos 3のオープンソース公開は、物理AIの研究開発を加速させる可能性がある。Linux Foundationのライセンスで公開されることで、競合他社や研究機関がNVIDIAの基盤モデルを利用できるようになり、エコシステムの標準化が進むとみられる。一方で、NVIDIAはハードウェアとソフトウェアの両面で優位性を築いており、基盤モデルの標準化は同社のプラットフォーム戦略を強化する可能性がある。 未確定の論点としては、Cosmos 3の実運用での性能や、ロボットへの実装例がまだ明らかでない点が挙げられる。また、オープンソース化によるコミュニティの活用状況や、競合他社の反応も今後の焦点になる。
なぜ重要か
Cosmos 3は、物理AIの基盤モデルを統合するNVIDIAの戦略を示すものであり、ロボットや自動運転などの具現化エージェントの開発に影響を与える可能性がある。オープンソース公開により、研究開発の民主化が進む一方、NVIDIAのエコシステムへの依存が強まる可能性もあり、業界の勢力図を変える可能性がある。