何が起きたか

2025年11月24日にarXivで公開された論文「Learning Massively Multitask World Models for Continuous Control」において、言語条件付きマルチタスク世界モデル「Newt」が発表された。Newtは200の多様なタスク(複数のドメインと embodiment を含む)で訓練され、デモンストレーションによる事前学習とオンライン強化学習を組み合わせる。

詳細

Newtは、言語条件付きのマルチタスク世界モデルであり、まずデモンストレーションで事前学習され、タスク認識表現と行動事前分布を獲得する。その後、全タスクにわたるオンライン相互作用で共同最適化される。実験では、Newtは複数の強力なベースラインよりも優れたマルチタスク性能とデータ効率を示し、強いオープンループ制御と未見タスクへの迅速な適応を実現したと報告されている。論文では、環境、デモンストレーション、訓練・評価コード、200以上のチェックポイントが公開されている。

Key Facts

論文「Learning Massively Multitask World Models for Continuous Control」がarXivで公開された(2025年11月24日)。[1]
Newtは言語条件付きマルチタスク世界モデルであり、200の多様なタスクで訓練される。[1]
Newtはデモンストレーションで事前学習され、オンライン相互作用で共同最適化される。[1]
実験では、Newtはベースラインより優れたマルチタスク性能とデータ効率を示したとされる。[1]
論文では、環境、デモンストレーション、コード、200以上のチェックポイントが公開されている。[1]

本紙の見方

今回の発表は、連続制御における強化学習(RL)のスケーラビリティに対する一石を投じるものだ。従来、連続制御のRLは単一タスクやオフライン設定が主流であり、オンラインRLはスケールしないという見方があった。Newtは、ファウンデーションモデルのレシピ(大規模事前学習+軽量RL)を連続制御に適用し、200タスクにわたるオンライン学習を実現した点で新規性がある。これは、ロボット工学や自動運転など、実世界の連続制御タスクへの応用可能性を示唆する。 本紙の過去報道との接続はないが、この研究は、マルチタスク学習と世界モデルの進展を示すものであり、今後のRL研究の方向性に影響を与える可能性がある。特に、言語条件付けとデモンストレーション事前学習の組み合わせは、タスクの一般化とデータ効率の向上に寄与するとみられる。 業界構造への含意としては、このようなマルチタスク世界モデルが実用化されれば、ロボットの汎用制御やシミュレーションから実環境への転移が加速する可能性がある。また、公開されたベンチマークとコードは、研究コミュニティの共通基盤として機能し、競争と協調を促進するだろう。 未確定の論点としては、Newtの実環境での性能、特にシミュレーションと実機のギャップ(sim-to-real)がどの程度克服できるかが焦点になる。また、200タスクの多様性が実際の応用に十分か、さらに大規模なタスク数でのスケーラビリティも検証が必要だ。

なぜ重要か

この研究は、連続制御におけるオンラインRLのスケーラビリティを示すものであり、汎用ロボット制御への道を開く可能性がある。公開されたベンチマークとコードは、今後の研究の基盤となり、業界全体の進歩を加速させるだろう。