何が起きたか

研究チームは2026年6月29日、世界基盤モデル「Orca」を発表した。Orcaは、連続動画からの無意識学習と言語記述イベントによる意識学習という2つの補完的パラダイムを採用し、次状態予測を中心とした統一的な状態遷移モデリングを実現する。事前学習には125K時間の動画データと160M件のイベント注釈を含む大規模データセットが構築された。

詳細

Orcaは、マルチモーダルな世界信号から統一的な世界潜在空間を学習し、マルチモーダルな読み出しインターフェースを通じてそれを公開する。従来のトークン・フレーム・アクション単位の予測ではなく、次状態予測に焦点を当てたモデリングを採用している。事前学習後、Orcaのバックボーンは凍結され、軽量なモダリティ固有デコーダのみが訓練可能となる。評価では、テキスト生成、画像予測、身体的行動生成の3つの下流タスクで、同規模の専門ベースラインを上回る性能を示したと報告されている。

Key Facts

Orcaは世界基盤モデルの初期実装であり、マルチモーダルな世界信号から統一的な世界潜在空間を学習する。[1]
事前学習には125K時間の動画データと160M件のイベント注釈を含む大規模データセットが構築された。[1]
Orcaは次状態予測を中心とした統一的な状態遷移モデリングを採用している。[1]
Orcaのバックボーンは凍結され、軽量なモダリティ固有デコーダのみが訓練可能である。[1]
Orcaはテキスト生成、画像予測、身体的行動生成の3つの下流タスクで、同規模の専門ベースラインを上回った。[1]

本紙の見方

今回の発表は、世界基盤モデルという新たな研究領域における具体的な初期実装を示した点で意義がある。従来の大規模言語モデルやビデオモデルが個別のモダリティに特化していたのに対し、Orcaはマルチモーダルな入力を統一的な潜在空間にマッピングし、そこから複数の出力モダリティを生成する点が新しい。特に、次状態予測という枠組みは、時間的な状態遷移をモデル化することで、世界のダイナミクスを捉えようとする試みであり、ロボティクスや自動運転などの分野への応用が期待される。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、世界基盤モデルという概念は、近年のAI研究における基盤モデルの拡張として位置づけられる。GPTなどの言語基盤モデルがテキスト生成で成功を収めた後、画像や動画、行動へと対象を広げる流れがあり、Orcaはその流れを統合する試みとみられる。 業界構造への含意としては、Orcaのアプローチが、データと計算資源の大規模な投資を必要とする点が挙げられる。125K時間の動画データと160M件のイベント注釈は、一般の研究機関では入手が難しく、大手テック企業や潤沢な資金を持つ研究組織に有利に働く可能性がある。また、統一的な潜在空間の学習は、異なるモダリティ間の転移学習を促進し、ロボットの行動生成やシミュレーション環境での活用が進むとみられる。 未確定の論点としては、Orcaの実用化における課題が挙げられる。論文では現在の限界について議論されているが、具体的な内容は不明である。また、下流タスクでの性能がベースラインを上回ったとされるが、その評価指標や比較対象の詳細は明らかにされていない。今後、実世界のロボットへの適用や、より大規模なデータでのスケーラビリティが検証される必要がある。

なぜ重要か

Orcaは、AIが世界を理解し予測するための新たなパラダイムを提案するものであり、ロボティクスや自動運転など、物理世界と相互作用するシステムの進化に影響を与える可能性がある。また、マルチモーダル基盤モデルの競争が激化する中で、次状態予測というアプローチが今後の標準となるかが注目される。