何が起きたか

研究チームは2026年8月31日、器用操作のための自己進化型汎用世界モデル「Motus2」を発表した。Motus2は単一モデルが政策(世界行動モデル)、シミュレータ(行動条件付き世界モデル)、評価器(価値モデル)の3つの制御インターフェースを共有し、閉ループの意思決定・学習サイクルを形成する。データスケーリングでは、大規模な単眼エゴセントリックデータから同期ステレオエゴセントリックデータへ進み、ロボット軌道と人間ロボット整合データによるロボット領域適応を行う。

詳細

Motus2は、モデルスケーリングとデータスケーリングの2つの軸で世界モデリングを前進させる。モデルスケーリングでは、共有重みを持つ単一モデルが政策(世界行動モデル)、シミュレータ(行動条件付き世界モデル)、評価器(価値モデル)の3つの制御インターフェースを公開する。政策は候補行動チャンクを提案し、シミュレータはその視覚的結果を予測し、評価器は予測結果を評価する。これらの結合が政策改善のための閉ループの意思決定・学習サイクルを形成する。データスケーリングでは、大規模な単眼エゴセントリックデータから同期ステレオエゴセントリックデータへ進み、その後ロボット軌道と補助的な人間ロボット整合データによるロボット領域適応を行う。さらに、スライディングウィンドウコンテキストのグローバル自己回帰拡張とハイブリッドメモリ拡張を研究し、接触認識制御のための触覚フィードバックを追加し、ステレオ視覚、双腕、双器用手、触覚センシングを備えた完全生体模倣プラットフォーム上でインスタンス化される。

Key Facts

Motus2は、政策(世界行動モデル)、シミュレータ(行動条件付き世界モデル)、評価器(価値モデル)の3つの制御インターフェースを共有重みで公開する。[1]
Motus2は、大規模な単眼エゴセントリックデータから同期ステレオエゴセントリックデータへ進み、ロボット領域適応を行う。[1]
Motus2は、触覚フィードバックを追加し、ステレオ視覚、双腕、双器用手、触覚センシングを備えた完全生体模倣プラットフォーム上でインスタンス化される。[1]
Motus2は、スライディングウィンドウコンテキストのグローバル自己回帰拡張とハイブリッドメモリ拡張を研究する。[1]
Motus2は、失敗した相互作用や準最適な相互作用をダイナミクスモデリングと価値学習のための証拠として利用する。[1]

本紙の見方

Motus2の核心は、世界モデルを単なるシミュレータとしてではなく、政策・シミュレータ・評価器の三者を閉ループで結合した自己進化システムとして構築した点にある。従来の世界モデルは行動出力ヘッドを付加するだけだったが、Motus2は政策が提案した行動の結果をシミュレータが予測し、評価器がその価値を判断することで、失敗や準最適な相互作用も学習に活用する。これは、ロボットが実世界で試行錯誤しながら自律的に改善するための基盤となる。 データスケーリングの戦略も注目に値する。単眼エゴセントリックデータからステレオ、ロボット領域適応へと段階的に進むことで、人間のデモンストレーションからロボットの動作へ知識を転移しつつ、実ロボットのデータで微調整する。このアプローチは、データ不足が課題とされる器用操作において、人間のデータを活用しながらロボット固有の特性に適応する現実的な道筋を示す。 さらに、触覚フィードバックの追加と完全生体模倣プラットフォームへの実装は、接触を伴う操作に必要な感覚情報を統合する点で重要だ。ステレオ視覚と触覚センシングを備えたプラットフォームは、実世界の複雑な操作タスクへの応用を視野に入れている。 一方で、Motus2の性能を定量的に示す実験結果は本要約には含まれておらず、具体的な成功率やベースラインとの比較は不明である。また、自己進化のループが実際にどの程度の改善をもたらすのか、長期的な安定性や計算コストも未検証の論点として残る。今後の論文本文や実験結果の公開が待たれる。

なぜ重要か

Motus2は、世界モデルを閉ループの自己進化システムとして設計することで、ロボットが実世界の経験から継続的に学習する可能性を示した。これは、単なるシミュレーション予測を超え、政策改善までを含む統合的な枠組みであり、器用操作の分野における新たな研究の方向性を提示する。