何が起きたか
2026年7月14日にarXivで公開された論文「FlowWAM: Optical Flow as a Unified Action Representation for World Action Models」において、研究チームはオプティカルフローを行動表現として用いる新しい世界行動モデル(WAM)を提案した。RoboTwin操作タスクで成功率92.94%(Clean設定)、92.14%(Random設定)を達成し、WorldArena世界モデリングではEWMScore 63.71を記録した。
詳細
FlowWAMは、事前学習済みのビデオ生成モデルを活用し、オプティカルフローをRGBビデオと同形式の行動表現として扱う。ポリシーモードではフローを生成して行動予測を行い、ワールドモデルモードでは目標フロー系列を用いて将来ビデオを生成する。フローは行動ラベルなしで生ビデオから抽出できるため、大規模な未ラベル動画データセットでの事前学習が可能となる。
Key Facts
| FlowWAMはオプティカルフローを統一的な行動表現として用いる二重ストリーム拡散フレームワークである。 | [1] |
| RoboTwin操作タスクで成功率92.94%(Clean設定)、92.14%(Random設定)を達成した。 | [1] |
| WorldArena世界モデリングでEWMScore 63.71を達成し、軌道精度で18.4%の相対改善を示した。 | [1] |
| フローは行動ラベルなしで生ビデオから抽出できるため、大規模な未ラベル動画データセットでの事前学習が可能である。 | [1] |
本紙の見方
今回のFlowWAMの提案は、世界行動モデル(WAM)における行動表現の設計に一石を投じるものだ。従来の数値的な行動表現はビデオ生成モデルとの整合性に欠け、視覚的な行動表現はフレーム間の時間的運動構造を捉えきれないという課題があった。FlowWAMはオプティカルフローを行動表現として採用することで、ビデオ生成モデルと親和性が高く、かつピクセル単位の変位情報を豊富に含む表現を実現している。この点は、既存のWAM研究の延長線上にありながら、行動表現の形式に新たな選択肢を加えるものである。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、WAM分野の進展として、ビデオ生成モデルを制御に活用する流れが続いている中で、行動表現の標準化が進む可能性を示唆する。FlowWAMのフロー表現は、行動ラベルなしのデータを活用できる点で、データ効率の向上に寄与する可能性がある。これは、ロボット学習におけるデータ不足という業界構造的な課題に対して、一つの解決策を提示するものだ。 業界構造への含意としては、ロボット操作や世界モデリングのベンチマークで高い性能を示したことで、今後の研究がフロー表現を基盤とする方向にシフトする可能性がある。また、フロー抽出の容易さから、実世界の動画データを活用した事前学習が進み、シミュレーションと実環境のギャップを埋める一助となるかもしれない。ただし、論文で報告された数値は特定のベンチマークにおけるものであり、実環境での汎用性や他のタスクでの性能は未検証である。 未確定の論点としては、FlowWAMの実ロボットへの適用時の性能、計算コスト、フロー表現の解釈可能性などが挙げられる。また、フロー表現が行動の高次元性や離散性をどの程度カバーできるかも今後の検証課題である。次に確認すべきは、他のベンチマークや実機での再現実験、およびフロー表現の限界を探る研究であろう。
なぜ重要か
FlowWAMは、行動表現としてオプティカルフローを用いることで、ビデオ生成モデルと制御を統合する新たな道を示した。これにより、ロボット学習におけるデータ効率と性能の両立が進む可能性があり、今後の世界行動モデルの設計に影響を与えるだろう。