何が起きたか

arXivは2026-10-01、論文「World Action Modeling with Progressive Visual Planning」を公開し、ロボット制御向けの世界行動モデルProWAMを示した。論文は、初期観測と指示から将来の視覚変化と行動を同時に予測する枠組みの中で、順序付きの疎な視覚サブゴールを追加し、行動生成を支える設計を採ったとしている。評価では、LIBERO-Plusで85.8%、randomized RoboTwinで75.7%、RoboCasa365で48.1%、Composite-Unseenで18.2%、ゼロショット実世界で70.0%の成功率を示したとしている。

詳細

ProWAMは、密な動画ロールアウトを生成せず、単一のvideo-backbone前向き計算で疎なサブゴール特徴をキャッシュし、再計画時には軽量な行動デノイジングのみを行う設計である。論文は、この構成により、アクションフリーの大規模動画からサブゴール予測を学習でき、動画バックボーンが複雑な視覚計画を担い、行動ポリシー側の負荷を下げられるとしている。 性能面では、LIBERO-Plusで85.8%、randomized RoboTwinで75.7%を記録し、最強の基準手法に対して最大+35.9%の相対改善を示したとしている。RoboCasa365では48.1%、難しいComposite-Unseen分割では18.2%で4位となり、ゼロショットの実世界実験では70.0%を達成し、最強基準の55.0%から+15.0ポイント、相対で+27.3%の改善だとしている。

Key Facts

arXivは2026-10-01に論文「World Action Modeling with Progressive Visual Planning」を公開した。[1]
論文はProWAMというprogressive world action modelを提案した。[1]
ProWAMは、行動予測と順序付きの疎な視覚サブゴール予測を同時に行う。[1]
評価ではLIBERO-Plusで85.8%、randomized RoboTwinで75.7%を示した。[1]
ゼロショット実世界実験では70.0%の成功率を示し、最強基準の55.0%を上回ったと論文は述べている。[1]

本紙の見方

ProWAMの新しさは、世界行動モデルの出力を「次の行動」と「順序付きの疎な視覚サブゴール」に分けた点にある。密な動画全体の未来を生成してから行動を決めるのではなく、進行度を持った少数の視覚目標を先に置くことで、長いタスクでの推論を軽くしようとしている。論文が強調するのは、単なる性能向上というより、視覚計画を動画バックボーンに寄せ、行動ポリシー側は再計画時の軽量デノイジングに絞る構成である点だと読める。 この点は、既存の世界行動モデルが長期予測で苦戦し、密な動画ロールアウトが非効率だという問題設定に直接つながる。ProWAMは、単一フレーム予測だけでは目標への進み方が抜け落ちるという別の弱点に対し、サブゴール列で補う折衷案を示した形である。つまり、動画生成のコストと目標到達の手がかり不足の間にあるトレードオフを、疎な中間目標で調整する設計だとみられる。 本紙の見方では、シミュレーションでの85.8%、75.7%という数字よりも、ゼロショット実世界で70.0%を出し、55.0%の基準を上回った点のほうが重要である。実環境では視覚の揺らぎ、物体配置、指示の曖昧さが効くため、進行度付きサブゴールが閉ループ制御の安定化に寄与した可能性がある。ただし、論文要旨だけでは、どの程度のタスク難度でどの失敗様式が減ったのか、サブゴール数や特徴量の粒度が性能にどう効いたのかは分からない。動画バックボーンの規模、学習データの内訳、再計画頻度、実機でのタスク種類を確認しないと、この方式の汎用性は判断しにくい。

なぜ重要か

論文が示したのは、ゼロショット実世界で70.0%の成功率を出した点であり、シミュレーションだけでなく実機寄りの閉ループ制御で評価したことに意味がある。ProWAMが主張するように、アクションフリー動画からサブゴール予測を学べるなら、行動ラベル付きデータに依存しない学習設計の余地が広がるため、ロボット制御のデータ収集負担に関心がある読者に関係する。