何が起きたか

研究チームは2026年8月26日、arxiv.orgで世界モデル「WALL-SS」を発表した。WALL-SSは、スケール単位の自己回帰(Scale-wise autoregressive Scaling)により視覚的未来を生成し、アクション制御可能で長時間のロボットシミュレーションを実現する。実験では、アクション追従と軌道精度の向上、分単位のストリーミング生成が確認された。

詳細

WALL-SSは、身体化された軌跡を、時間的にインターリーブされた観測とアクションの因果シーケンスとして表現する。これにより、アクション依存の状態遷移を明示し、可変長生成、再利用可能な因果状態によるストリーミング拡張、シーケンス確率による直接最適化を自然にサポートする。長時間ホライズンでは、各未来観測を粗から細へ生成し、同じ階層内で3つの補完的コンポーネントを開発した。アクション条件付き次スケール予測は、スケール整合アクション表現を注入し、アクションと未来の結合を改善し、成功と失敗の両方の行動をモデル化する。スケール圧縮長時間メモリは、最近のインタラクションを高解像度で保持し、遠い観測とアクションを圧縮する。スケール単位のドリームフォーシングは、自己生成コンテキストへのロバスト性を強化する。オンポリシーアライメントは、アクション追従と長期一貫性の報酬で自己回帰視覚ダイナミクスを最適化し、事前学習済みの視覚分布を維持する。

Key Facts

WALL-SSは、スケール単位の自己回帰により視覚的未来を生成する世界モデルである。[1]
WALL-SSは、身体化された軌跡を、時間的にインターリーブされた観測とアクションの因果シーケンスとして表現する。[1]
WALL-SSは、アクション条件付き次スケール予測、スケール圧縮長時間メモリ、オンポリシーアライメントの3つのコンポーネントを持つ。[1]
実験では、WALL-SSはアクション追従と軌道精度を改善し、分単位のストリーミング生成を実現した。[1]
オンポリシーアライメントは、アクションドリフトと長時間の不整合を低減する。[1]

本紙の見方

WALL-SSの提案は、ロボット学習における世界モデルのスケーリングに新たな軸を加える。従来の世界モデルがクリップ単位の未来予測に留まっていたのに対し、WALL-SSはスケール単位の自己回帰を導入し、長時間ホライズンの生成を可能にした点が新規性の中核である。このアプローチは、観測とアクションを因果シーケンスとして統一的に扱うことで、アクション制御と可変長生成を自然にサポートする。 本稿の関連記事は存在しないが、ロボット学習における世界モデルの研究動向を踏まえると、WALL-SSはシミュレーション、プランニング、ポリシー評価、ロボット学習への応用可能性を広げるものと位置づけられる。特に、アクション条件付きの次スケール予測は、ロボットの行動生成と未来予測の結合を強化し、成功と失敗の両方をモデル化できる点で、実ロボットへの適用を意識した設計と言える。 業界構造への含意として、WALL-SSのような長時間ホライズンの世界モデルは、ロボットのシミュレーション環境の精度向上に寄与し、実機での試行錯誤を減らす可能性がある。これにより、ロボットの学習コスト削減や、安全なポリシー評価が可能になるとみられる。また、スケール圧縮メモリとストリーミング生成は、計算資源の制約下での長時間予測を実現する技術であり、エッジデバイスでの展開も視野に入る。 未確定の論点としては、WALL-SSの実ロボットへの適用時の性能、特に実世界のノイズや多様性に対するロバスト性が挙げられる。また、オンポリシーアライメントの報酬設計が、どの程度タスク固有の知識を必要とするかも検証が必要である。さらに、分単位のストリーミング生成が、実際のロボット制御のリアルタイム性に耐えうるかは、計算コストの観点から確認が待たれる。

なぜ重要か

WALL-SSは、ロボットが長時間のインタラクションを予測する能力を向上させることで、シミュレーションから実機への転移を効率化し、ロボット学習の実用化を後押しする可能性がある。また、アクション制御可能な世界モデルは、プランニングやポリシー評価の新たな手法を切り開く基盤となる。