何が起きたか
2026年6月4日にarXivで公開された論文で、研究者らは世界言語行動(WLA)モデルという新しいクラスの具現化基盤モデルを提案した。WLAは、テキスト指示、画像、ロボット状態を入力として、テキストのサブタスク、サブゴール画像、ロボットの行動を同時に予測する。プロトタイプのWLA-0は、2Bのアクティブパラメータを持ち、NVIDIA RTX 5090上で推論あたり40ミリ秒を達成し、RoboTwin2.0 Cleanで92.94%、RMBenchで56.5%の成功率を示した。
詳細
WLAモデルは、世界モデリングインターフェースと言語推論能力を統合する。コアには自己回帰(AR)トランスフォーマーバックボーンを使用し、次状態を予測する。次状態は、意味レベルのテキスト意図と、補完的な詳細な物理ダイナミクスから構成される。物理ダイナミクスは、専用のWorld Expertに基づく世界モデリング目的で教師され、Action Expertの状態と行動の相関の特性評価を容易にする。WLAはメタクエリを利用して、世界予測が暗黙的に行動生成に影響を与えるようにし、推論中は世界予測を無効化できる。また、世界予測を有効化してテスト時スケーリングを可能にし、ロボット制御を改善する。
Key Facts
| WLAモデルは、テキスト指示、画像、ロボット状態を入力とし、テキストのサブタスク、サブゴール画像、ロボットの行動を同時に予測する。 | [1] |
| WLAのコアは自己回帰(AR)トランスフォーマーバックボーンであり、次状態を予測する。 | [1] |
| WLA-0プロトタイプは2Bのアクティブパラメータを持ち、NVIDIA RTX 5090上で推論あたり40ミリ秒を達成した。 | [1] |
| WLA-0はRoboTwin2.0 Cleanで92.94%、RMBenchで56.5%の成功率を達成した。 | [1] |
| WLA-0は、アクションアノテーションなしでクロスエンボディロボットビデオから新しいタスクを学習する可能性を秘めている。 | [1] |
本紙の見方
今回の提案は、具現化基盤モデルの設計において、世界モデルと言語推論を統合する点で新規性がある。従来の世界行動モデル(WAM)は双方向拡散トランスフォーマーを用いて世界モデリングに焦点を当て、視覚言語行動(VLA)モデルは言語推論に焦点を当てていた。WLAは自己回帰トランスフォーマーを採用し、世界モデリングと言語推論を単一のフレームワークに統合することで、長期的なタスクの解決と物理ダイナミクスの理解を両立させようとしている。 本紙の過去報道との接続は、関連記事が提供されていないため、直接的な連続性を指摘することはできない。しかし、具現化AIの分野では、世界モデルと行動生成の統合は活発な研究テーマであり、WLAはその流れに沿った新しい試みと位置づけられる。 業界構造への含意としては、WLAのようなモデルが実用化されれば、ロボットのタスク学習におけるデータ効率と汎用性が向上する可能性がある。特に、アクションアノテーションなしでクロスエンボディビデオから学習できる可能性は、データ収集のコストを削減し、多様なロボットへの適応を容易にする。これは、ロボット産業におけるソフトウェア層の競争力を高め、ハードウェアの差別化よりもソフトウェアの優位性が重要になる可能性を示唆する。 未確定の論点としては、WLA-0の実環境での性能がシミュレーションとどの程度一致するか、また、世界予測を無効化した場合の性能低下の程度が挙げられる。さらに、2Bのアクティブパラメータという規模が、より複雑なタスクや実世界の多様性に対して十分かどうかも検証が必要である。
なぜ重要か
WLAモデルは、世界モデリングと言語推論を統合することで、ロボットの長期的なタスク遂行能力を向上させる可能性がある。これは、ロボットがより複雑な指示を理解し、環境の物理的ダイナミクスを考慮して行動することを可能にし、産業用ロボットやサービスロボットの応用範囲を広げる一歩となる。