何が起きたか

arXivは2026-09-23付で、World Action Modelの新手法「Latent evolving World Action Model」を公開した。論文は、動画拡散モデルの事前学習に依存せず、JEPA埋め込みを条件に行動生成を行うLeWAMを提案し、学習可能パラメータを0.4Bに抑えた。あわせて、デモンストレーションから直接選好監督を作るDemoDPOも導入し、RoboTwin 2.0で平均成功率92.28%を報告している。

詳細

論文は、従来のVDMベースのWAMがVAEによる圧縮潜在表現と大規模な動画拡散バックボーンに依存していた点を問題視し、JEPAエンコーダ由来の予測埋め込みの方が行動生成に適していると結論づけた。エンコーダ比較ではI-JEPAが最良だったとしている。 LeWAMは、同一空間で未来埋め込みを予測して環境変化をモデル化する設計で、動画拡散バックボーンを使わない。さらに、追加の環境対話や、人手によるリセット・安全確認を要しないオフラインの選好精緻化段階としてDemoDPOを導入した。論文は、実世界の操作タスクでも実用性を維持するとしている。

Key Facts

arXiv掲載日: 2026-09-23[1]
論文名は「Latent evolving World Action Model」である[1]
LeWAMはJEPA埋め込みを条件に行動生成し、動画拡散バックボーンに依存しない[1]
学習可能パラメータは0.4Bである[1]
RoboTwin 2.0で平均成功率92.28%を報告した[1]

本紙の見方

本件の新しさは、World Action Modelを動画拡散モデルの表現に寄せる従来型の設計から外し、JEPA系の予測埋め込みを中核に置いた点にある。論文は、VAEで圧縮した潜在表現よりも予測埋め込みの方が行動生成を支えやすいと整理しており、性能の議論を「より大きな動画生成バックボーンを積むかどうか」から「どの視覚表現が行動に効くか」へ移している。ここで主役はモデル規模そのものではなく、表現設計と学習段階の切り分けである。 また、DemoDPOの位置づけも重要である。論文は、模倣学習だけでは「示された行動」を再現できても「より良い行動」と「悪い行動」を区別しにくいとして、その不足をオフラインで補う枠組みを示した。これは、環境との追加対話を避けつつ、人手によるリセットや安全確認の負担も増やさずに選好を反映しようとする設計であり、WAMの改善点が学習データの量ではなく、デモンストレーションの使い方に移っている。 比較で見ると、I-JEPAがエンコーダ比較で最良とされ、LeWAMは0.4Bの学習可能パラメータでRoboTwin 2.0平均92.28%を示した。ここから読めるのは、今後の論点が単純なパラメータ増ではなく、どの表現を凍結し、どこを軽量に適応させるかに移ることだ。とくに実機操作での有効性をうたう以上、次に確認すべきは、RoboTwin 2.0以外のタスクへの再現性、DemoDPOの寄与の切り分け、そして実機での失敗パターンがどの程度残るかである。

なぜ重要か

LeWAMは、動画拡散モデルに重い事前学習コストを掛けずにWorld Action Modelを構成する可能性を示した点で、ロボット操作の学習設計に関わる。論文が示す0.4Bの学習可能パラメータと92.28%のRoboTwin 2.0平均成功率は、モデルの大型化以外の経路があることを示す根拠になる。 また、DemoDPOは追加の環境対話を要しないとしており、実機試験や安全確認の負担を抑えたい研究・開発現場にとって関心が高い。

日本への影響

日本のロボット研究や製造現場で関心があるのは、動画生成基盤を前提にせずに操作方策を作るこの設計が、データ収集や計算資源の制約をどう緩和しうるかである。特に、実機操作の検証負担を抑えるDemoDPOのようなオフライン精緻化は、試験回数や安全確認のコストを重く見積もる現場で論点になるとみられる。