何が起きたか
arXivに2026-09-29付で掲載された論文は、World-Action Models(WAMs)の学習手法としてDirect Experience World-Model Optimization(DEWO)を提案した。DEWOは、行動模倣に加えて視覚経験から世界表現を更新し、物理相互作用の展開予測をより良く条件づける設計である。論文は、DexJoCoの5課題と、WujiおよびSharpaの実機4課題で評価し、2回のデプロイメント学習後に成功率が改善したとしている。
詳細
論文はDEWOについて、相互作用の転換点を特定し、成功した未来と失敗した未来の両方から学ぶことで classifier-free guidance を支えると説明している。さらに、タスク進捗を動画表現から推定する価値ヘッドを追加し、推論時に進捗が停滞した場合に guidance を有効化する構成を採るとしている。 実験では、DexJoCoの5課題で3種類のWAM実装すべてに平均成功率の改善がみられたとし、実機の4課題では3×3のグリッド評価で、少なくとも1回の初期成功があったセルに限ると、2回のデプロイメント学習後の成功率が51.0%から71.7%へ上昇したとしている。差分は20.7ポイントである。
Key Facts
| Direct Experience World-Model Optimization(DEWO)を提案した。 | [1] |
| 対象はWorld-Action Models(WAMs)で、行動模倣に加えて視覚経験から世界表現を更新する設計である。 | [1] |
| 相互作用の転換点を特定し、成功した未来と失敗した未来の両方から学んで classifier-free guidance を支える。 | [1] |
| 動画表現からタスク進捗を推定する価値ヘッドを追加し、推論時に進捗停滞で guidance を作動させる。 | [1] |
| DexJoCoの5課題とWuji・Sharpaの実機4課題で評価し、実機では2回のデプロイメント学習後に成功率が51.0%から71.7%へ上昇した。 | [1] |
本紙の見方
DEWOの新規性は、WAMsの事後学習を「行動の模倣」だけで終わらせず、視覚経験から世界表現そのものを更新対象に置いた点にある。DexJoCoの5課題と実機4課題という評価枠組みを見ると、論文は単なる予測精度の改善ではなく、予測と制御の結合をどこまで実運用に近い条件で押し上げられるかを問うている。特に、成功・失敗の両未来を学習に使い、進捗が止まった局面で guidance を切り替える設計は、誤差が積み上がりやすい器用作業に対する具体的な対処である。 本紙の見方では、この論文はWAMを「方策モデル」から「経験で更新される世界モデル」へ寄せる提案だと位置づけられる。ここで重要なのは、学習の入力が行動ラベルだけでなく、相互作用の分岐点とその後の成功・失敗動画に広がっていることだ。つまり、ロボットの制御改善と環境理解の更新が同じループに入っており、実機での反復学習を前提にした構造になっている。これは、実世界データを使って再学習する流れを明示的に組み込む点で、従来の模倣中心の更新とは異なる。 一方で、論文が示すのは評価条件付きの改善であり、どの程度の汎用性を持つかはまだ切り分けが必要である。DexJoCoの平均改善が、課題ごとのばらつきをどこまで覆っているのか、実機4課題のうち初期成功がなかったセルではどう振る舞うのか、そして2回を超えるデプロイメント学習で改善が続くのかが次の確認点になる。あわせて、価値ヘッドと guidance の切替条件が、別のロボット本体や別の接触豊富な作業にそのまま移せるかも未確定である。
なぜ重要か
論文が示した51.0%から71.7%への改善は、実機の反復学習で成功率を押し上げるために、行動生成だけでなく世界表現の更新が効く可能性を示す。WAMの更新対象を「動作」だけでなく「経験から得た予測」に広げることで、器用作業の失敗が積み上がる局面への対処法が変わるとみられる。
日本への影響
日本関連の明確な対象や供給先は本文にないため、具体的な日本への示唆は限定的である。