何が起きたか
研究チームは2026年8月27日、身体化知能のためのWorld Action Model「Riemann-1.0」を発表した。同モデルは、マルチビュー視覚観察・ロボット状態・身体固有の行動を単一の因果自己回帰シーケンスとして統合し、ロボットの行動と世界の進化を因果的な状態遷移として表現する。20万時間以上のインタラクションデータに基づき、シミュレーションと実世界の操作タスクで最高性能を達成。実世界の長期的操作では成功率85.0%、進行成功率94.4%を記録し、最強のオープンソースベースラインを成功率で15%上回った。
詳細
Riemann-1.0は、既存のWAM(World Action Model)が採用するジョイント生成・ビデオファースト予測・分離モデリングのパラダイムとは異なり、オンラインのロボットポリシー実行と行動条件付き世界シミュレーションを単一モデルに統合。実行可能なロボットポリシーとマルチ身体の視覚世界シミュレーターの両方として機能する。学習には、自己中心視点の人間ビデオ、ハンドヘルドグリッパーのデモ、異種ロボットの軌跡を共通のWorld Action Modeling目的で統合する段階的身体事前学習フレームワークを採用。20万時間以上のインタラクションデータで事前学習し、大規模な身体化経験を実行可能なロボット操作能力へ段階的に転移させる。ベンチマークでは、RoboTwin2.0で94.3%、LIBEROで99.0%、長期的構成ベンチマークのRoboCasa-365で62.6%の成功率を達成し、従来の最良手法を8.4%上回った。
Key Facts
| Riemann-1.0は、マルチビュー視覚観察・ロボット状態・身体固有の行動を単一の因果自己回帰シーケンスとして統合する完全因果自己回帰型のWorld Action Modelである。 | [1] |
| 20万時間以上のインタラクションデータに基づき、段階的身体事前学習フレームワークで学習する。 | [1] |
| 実世界の長期的操作タスクで成功率85.0%、進行成功率94.4%を達成し、最強のオープンソースベースラインを成功率で15%上回った。 | [1] |
| シミュレーションベンチマークでは、RoboTwin2.0で94.3%、LIBEROで99.0%、RoboCasa-365で62.6%の成功率を達成し、従来の最良手法を8.4%上回った。 | [1] |
| 既存のWAMのパラダイム(ジョイント生成、ビデオファースト予測、分離モデリング)とは異なり、オンラインのロボットポリシー実行と行動条件付き世界シミュレーションを単一モデルに統合する。 | [1] |
本紙の見方
Riemann-1.0の発表は、身体化AIの分野で「世界モデル」と「ロボットポリシー」を単一の因果自己回帰モデルに統合する新たな方向性を示す。従来のWAMは、ビデオ生成や分離モデリングが主流であり、ロボットの行動と世界の進化を別々に扱うことが多かった。Riemann-1.0はこれらを統合し、ロボットの行動と世界の状態遷移を同一のシーケンスで表現することで、ポリシー実行と世界シミュレーションを一つのモデルで実現する。この設計は、実世界のデータ効率と汎化性能の向上に寄与しているとみられる。 本モデルの核心は、20万時間以上のインタラクションデータを用いた段階的身体事前学習にある。人間のビデオ、ハンドヘルドグリッパーのデモ、異種ロボットの軌跡を共通の目的関数で学習することで、大規模な身体化経験をロボット操作能力へ転移させる。このアプローチは、データの多様性を活かしつつ、ロボット固有の行動と世界のダイナミクスを同時に学習する点で独自性が高い。 業界構造への含意として、Riemann-1.0の成功は、ロボットの操作能力を向上させるためのデータとモデル設計の重要性を再確認させる。特に、実世界の長期的タスクで成功率85.0%を達成したことは、産業用ロボットやサービスロボットへの応用可能性を示唆する。一方で、シミュレーションと実世界のギャップは依然として課題であり、RoboCasa-365での成功率62.6%は、長期的な構成タスクの難しさを浮き彫りにしている。 未確定の論点として、Riemann-1.0のモデル規模や計算資源、学習データの詳細な構成比は公開されていない。また、実世界での汎化性能がどの程度のロボットプラットフォームで検証されたのか、特定のハードウェアに依存するのかは不明である。今後の研究では、異なる身体構造やタスクへの適用可能性、モデルのスケーラビリティが焦点になるだろう。
なぜ重要か
Riemann-1.0は、ロボットの行動と世界の進化を単一モデルで扱うことで、身体化AIの設計パラダイムを転換する可能性がある。実世界での高い成功率は、ロボットの実用化に向けた一歩となるが、モデルの汎化性とデータ効率のさらなる検証が求められる。