何が起きたか

arxiv.orgは2026-10-06、OpenWAMという世界行動モデルの公開枠組みを発表した。WAN2.2-5Bを起点に、10,000時間超の動画で因果的なロボット動画事前学習を行い、行動専門家を共有Mixture-of-Transformersに統合する設計である。生成方式はjoint、video-then-action、action-then-video、decoupledに対応し、LIBEROの4系統と実機の両腕タスクで性能を検証した。

詳細

同論文によると、OpenWAMは共通の因果的ロボット動画基盤と、設定可能な動画-行動インタラクションを中心に据える。行動専門家の統合後は、同一のアーキテクチャで逆動力学と順動力学にも拡張でき、反事実的遷移が独立学習済みの動力学モデルに与える影響を調べられるとしている。 数値面では、LIBERO-LongでのVTA成功率が68.4%から97.8%へ上がった。新しいタスクに対して動画予測器だけを適応した条件では、反事実データと実演で学習した局所文脈の逆動力学モデルが、LIBERO-90の4つの保留タスクで平均84.0%の成功率を示し、全文脈逆動力学モデルの47.0%、実演のみの局所文脈モデルの21.5%を上回った。順動力学では、反事実教師あり学習によりRGB予測誤差が34.5%低下し、16個の同一状態結果のうち結果識別率が21.1%から71.3%に上がった。

Key Facts

OpenWAMは世界行動モデル向けの公開枠組みである。[1]
起点はWAN2.2-5Bで、10,000時間超の動画で因果的ロボット動画事前学習を行う。[1]
共有Mixture-of-Transformersで行動専門家を統合し、joint、video-then-action、action-then-video、decoupled生成に対応する。[1]
LIBERO-LongでのVTA成功率は68.4%から97.8%に向上した。[1]
反事実データと実演で学習した局所文脈の逆動力学モデルは、LIBERO-90の4タスクで平均84.0%の成功率を示した。[1]

本紙の見方

OpenWAMの新しさは、世界行動モデルを単なる予測器でも単なる制御器でもなく、因果的ロボット動画基盤の上に複数の生成・推論様式を差し替え可能な枠組みとして整理した点にある。特に、joint、video-then-action、action-then-video、decoupledを同じ土台で比較できるため、モデル性能そのものだけでなく、どの結合方法がどのタスクで効くかを分解して見られる。10,000時間超の動画による事前学習と、行動専門家の共有Mixture-of-Transformers統合が中核であり、ここは既存の個別実装を一つに束ねる設計思想といえる。 本紙の見方では、今回の焦点は「性能が高いモデルが出た」ことより、動画予測と行動生成、さらに逆動力学・順動力学までを同一設計で横断できる共通試験台を示した点にある。LIBERO-Longで68.4%から97.8%への改善は、因果的ロボット動画事前学習と行動専門家の統合が少なくともこのベンチマークでは効いていることを示すが、どの要素が改善の主因かはまだ切り分けが必要である。反対に、動画予測器だけを新タスクに適応し、逆動力学を反事実データで学習したときに84.0%まで伸びた結果は、成功実演だけでは足りない学習信号を補える可能性を示す。これは、模倣学習の延長というより、失敗や反事実遷移を含むデータ設計へ重心が移ることを示唆する。 産業構造への含意としては、ロボット基盤モデルの競争軸が、単一タスクの精度から、動画データの量、反事実教師の作り方、そして生成と制御をどう接続するかへ移っている点が大きい。10,000時間超の動画という前提は、データ収集とアノテーションの設計を技術差に変えるため、モデル本体だけでなく学習データの作り方が差別化要因になりやすい。加えて、順動力学でRGB誤差を34.5%下げ、結果識別率を21.1%から71.3%へ上げた事実は、実機適用では行動出力だけでなく状態遷移の予測精度が重要になることを示す。 未確定の論点は、LIBERO以外の実環境や長期タスクで同じ改善が再現するか、反事実データをどのように取得・生成したか、そして共有Mixture-of-Transformersの各枝の寄与である。さらに、10,000時間超の動画がどの種類のロボット、視点、操作対象を含むかは、一般化可能性を判断するうえで重要だが、要旨だけでは見えない。

なぜ重要か

OpenWAMは、ロボット制御を動画予測と切り離さずに扱うことで、学習データの設計が性能に直結することを示している。特に、成功実演だけでなく反事実データを使った逆動力学・順動力学の改善が示されたため、ロボットの学習では「何が成功したか」だけでなく「何が起こりえたか」をどう集めるかが論点になる。

日本への影響

日本のロボット研究や産業にとっては、機体の出来だけでなく、10,000時間超の動画のような大規模データ基盤と反事実データの作り方が競争力の一部になることを示す材料である。実機の両腕タスクやLIBERO系ベンチマークに近い検証系を持つ企業・研究機関は、動画収集、状態遷移の記録、学習用データ生成の設計をどこまで内製化できるかが焦点になる。