何が起きたか
arXivは2026年10月1日、71.5Mパラメータの世界行動モデル「PEWAM」を扱う論文「Keep the Effect, Drop the Actor: Programmable Effect-to-Execution World-Action Models」を公開した。論文は、ロボットのデモンストレーションから演者を外し、対象物の3Dキーポイント軌跡、把持点2点、最終的なシーン状態を「効果プログラム」として表現する手法を示した。著者らによると、このプログラムを固定して実行をサンプリングすることで、推論をプログラミングに置き換える設計だとしている。
詳細
PEWAMは、効果・ロボット実行・アクション・終端状態の4本のストリームを、独立したflow-matching timeで生成する。論文では、LIBERO-Goalの保留タスクで1回のデモンストレーションから40/90エピソードを完了し、同じバックボーンに目標画像または言語を与える方法や、公表済みのデモ条件付き手法は最大19にとどまったとしている。 また、Meta-Worldの保留3クラスでは公表済み最良結果を上回ったが、5クラス平均では上回らなかった。プログラムは座標の集合であるため編集可能で、終端状態をずらすと配置が追随し、接触点を回転すると把持も変わる。さらに、4種類のロボットアームで再学習なしに動作し、押し操作の後に再解決すると23/60エピソードを完了した一方、デモンストレーションの再生では6/60だったとしている。Frankaアームでは、他タスクの実デモで微調整したうえで、単一の人間動画からコンパイルしたプログラムが40試行中36を完了し、同じバックボーンに動画の最終フレームを目標画像として与えた場合の22を上回った。
Key Facts
| 論文名は「Keep the Effect, Drop the Actor: Programmable Effect-to-Execution World-Action Models」である。 | [1] |
| PEWAMは71.5Mパラメータの世界行動モデルである。 | [1] |
| デモンストレーションを3Dキーポイント軌跡、把持点2点、終端状態からなる「効果プログラム」に変換する。 | [1] |
| LIBERO-Goalの保留タスクで40/90エピソードを完了し、同条件の他手法は最大19だった。 | [1] |
| 4種類のロボットアームで再学習なしに動作し、Frankaアームでは40試行中36を完了した。 | [1] |
本紙の見方
この論文の新しさは、ロボットの「何が起きたか」を残しつつ、どのアームがそれを起こしたかを切り離し、実行を後段で再合成する点にある。単なる模倣学習の精度向上ではなく、デモンストレーションを座標ベースのプログラムへ変換し、そのプログラムを異なる実機や状態変化に対して再解決できる構成が主題である。一方で、71.5Mパラメータというモデル規模や、4本のstreamを独立したflow-matching timeで生成する設計は、汎用的な視覚言語モデルというより、運動と状態遷移を分離して扱う実行モデルとして位置づく。 本紙の関連記事はないため、過去報道との接続はない。公開情報からは、従来の「ゴール画像」「言語」「デモ再生」による条件付けと、この論文の「効果プログラム」の差が読み取れる。前者は入力をそのまま目標として扱うのに対し、後者は終端状態や把持点を編集できるため、同じデモから複数の実行方針を生みやすい。LIBERO-Goalで最大19に対して40/90、押し後の再解決で23/60対6/60という差は、単発の再現ではなく、環境が少し崩れた後の復帰にこの表現が効く可能性を示す。 業界構造への含意としては、ロボットの学習データが「動画そのもの」から「編集可能な効果表現」へ移るかどうかが焦点になる。もしこの表現が一般化すれば、データ収集では実演の撮影だけでなく、把持点や終端状態を後から操作できる注釈設計が重要になる。逆に、5クラス平均では最良結果を上回っていないため、タスク横断での頑健性はまだ限定的だと読める。今後は、どの種類のタスクで編集可能性が性能に直結するのか、4種類のアーム間でなぜ再学習なしに移せるのか、そして人間動画からのコンパイルがどこまで実機のばらつきに耐えるのかを確認する必要がある。
なぜ重要か
論文は、1回のデモンストレーションを編集可能な座標プログラムに変え、4種類のロボットアームで再学習なしに動かせたと報告している。これは、ロボットの学習・運用で必要になるデータ形式を、動画記録中心から状態・接触点・終端状態を含む表現へ寄せる可能性がある。
日本への影響
日本のロボット研究や製造現場にとっては、実演動画の収集だけでなく、把持点や終端状態を扱えるデータ設計が論点になるとみられる。特に、異なるアーム間で再学習なしに動いたという記述は、機種差をまたぐ実装でソフト側の調整負荷をどこまで下げられるかという課題に接続する。