何が起きたか

arXivは2026-09-29、論文「EVO-WAM: Evolving World Action Models through Video-Action Verification」を公開した。論文は、追加の専門家デモンストレーションを集めずに、World Action Modelsを未見タスクへ適応させる枠組みを提示している。評価では、RoboTwin 2.0の未見7タスクでCosmos3の平均成功率が26.9%から68.0%に、DreamZeroが28.5%から46.4%に上昇した。

詳細

EVO-WAMは3段階で構成される。第1に、state predictionとanchored multi-frame contextをWAM学習に加え、外部実行フィードバックなしで自己回帰ロールアウトを完結させる。第2に、vision-language modelでタスク完了のprefixを選別し、inverse dynamics modelで動画と行動の整合性を検証して、信頼できる訓練経験を抽出する。第3に、検証済みprefixでWAMを反復学習し、更新後モデルで新しいロールアウトを生成する。 実験結果として、RoboTwin 2.0の未見7タスクでは、Cosmos3が26.9%から68.0%へ、DreamZeroが28.5%から46.4%へ改善した。論文はこれを初期成功率の約2.5倍と約1.6倍としている。さらに、実世界の未見3つの長期複合タスクでは、Cosmos3の平均成功率が20.0%から76.7%へ、56.7ポイント上昇した。

Key Facts

arXivは2026-09-29に「EVO-WAM: Evolving World Action Models through Video-Action Verification」を公開した。[1]
EVO-WAMは、外部環境で候補行動を実行せずに、WAMを未見タスクへ適応させる枠組みである。[1]
手法は、state predictionとanchored multi-frame context、vision-language modelによるprefix選別、inverse dynamics modelによる整合性検証、反復学習の3段階で構成される。[1]
RoboTwin 2.0の未見7タスクで、Cosmos3の平均成功率は26.9%から68.0%に上昇した。[1]
実世界の未見3つの長期複合タスクで、Cosmos3の平均成功率は20.0%から76.7%に上昇した。[1]

本紙の見方

今回の論文の新しさは、ロボット方策の改善に必要な学習信号を、外部環境での試行ではなく、自身が生成した動画・行動系列の検証から取り出そうとしている点にある。WAM自体は動画 priors を使って未来動画と行動を同時に予測する発想であり、EVO-WAMはその延長線上で、state prediction、anchored multi-frame context、video-action verificationを組み合わせて未見タスクへの適応を狙う。既定路線の延長である一方、候補行動を実行して確かめる従来型の反復を避ける設計は、学習コストと失敗試行の扱いを変える。 本紙の関連記事はないため、過去報道との連続性はここでは置けない。ただし、論文の構造からみると焦点は「ロボットが何を見たか」より「その動画が完了状態を本当に表しているか」「行動と映像が一致しているか」に移っている。vision-language modelで完了prefixを選び、inverse dynamics modelで整合性を確かめる設計は、生成動画の見かけ上の成功と実行可能性を切り分ける意図があると読める。 業界構造への含意は、学習データの集め方にある。未見7タスクでCosmos3が26.9%から68.0%、DreamZeroが28.5%から46.4%へ上がったという事実は、単純な追加デモ収集ではなく、既存モデルが自分で作る軌跡をどこまで再利用できるかが重要な論点になっていることを示す。実世界の未見3タスクで20.0%から76.7%へ改善した点は、シミュレーション内だけで完結する話ではないことも示すが、どの程度の条件でこの改善が再現するかはまだ確認が必要である。次に見るべきなのは、成功率改善の対象がどのタスク類型まで広がるか、検証に使うVLMとinverse dynamics modelの依存度、そして更新後モデルが長期タスクでどこまで安定するかである。

なぜ重要か

arXivが示した実験結果では、未見タスクに対して追加の専門家デモンストレーションを集めなくても成功率を引き上げられる可能性がある。ロボット学習では、データ収集の手間と失敗試行のコストが課題になりやすく、この枠組みはその負担を減らす方向の手法として読むことができる。 一方で、改善はCosmos3とDreamZero、RoboTwin 2.0の7タスク、実世界の3つの長期複合タスクという限られた評価条件に基づく。したがって、適用条件がどこまで広いかは、今後の再現実験と追加ベンチマークで確認する必要がある。