何が起きたか

arxiv.orgは2026-09-29付で、論文「Rethinking Representations for World-Action Modeling」を公開した。論文は、ロボット方策と将来観測の予測を同時に学ぶ世界行動モデルにおいて、表現空間の設計を比較実験で検討した。結果として、復元忠実度や事前学習済み知覚特徴だけでは有効な方策学習は保証されないと結論づけ、ReWAMを提案している。

詳細

ReWAMは事前学習済みDINO特徴を基盤にし、Feature CalibrationとTemporal Representation Bottleneckでそれらを動力学モデリングに適したコンパクトな世界状態へ整理する設計である。さらにAction-Grounded Representation Shapingにより、ボトルネックにはアクション損失の勾配のみを流し、表現が何を符号化するかを方策が形づくりつつ、世界モデルはその変化を学ぶ構成をとる。 論文は、生成的な動画事前学習を使わずにRoboTwin 2.0で93.6%の成功率を達成したとしている。RoboDojoでは、約600時間の身体性事前学習データを用いて、平均スコア12.29、成功率8.28%を示した。

Key Facts

論文名は「Rethinking Representations for World-Action Modeling」である。[1]
公開日は2026-09-29である。[1]
ReWAMは事前学習済みDINO特徴を基盤にする。[1]
Action-Grounded Representation Shapingは、アクション損失の勾配のみをボトルネックに流す設計である。[1]
ReWAMはRoboTwin 2.0で93.6%の成功率を示した。[1]
RoboDojoでは約600時間の身体性事前学習データを用い、平均スコア12.29、成功率8.28%を示した。[1]

本紙の見方

この論文の新しさは、世界行動モデルを「何を予測するか」ではなく「どの表現を通して制御と予測を結ぶか」という設計問題として切り出した点にある。復元忠実度や事前学習済み特徴の有無だけでは方策学習が十分でないと示したうえで、DINO特徴をそのまま使うのではなく、Feature CalibrationとTemporal Representation Bottleneckで圧縮・整形し、Action-Grounded Representation Shapingで方策側の勾配を表現設計に反映させている。ここでは生成動画の事前学習を使わずにRoboTwin 2.0で93.6%を得た点が、単なる大規模事前学習依存とは異なる主軸である。 本紙の過去報道はないため、連続性の議論はできない。ただし公開情報の範囲では、ReWAMは既存の世界モデル系手法に対し、観測の再構成を重視する流れから一歩離れ、制御に必要な表現そのものを損失で誘導する構成に寄せている。つまり、入力の高精細さよりも、アクションで更新される中間状態の設計が性能を左右するという立場が前面に出ているとみられる。 業界構造への含意としては、ロボット学習のボトルネックが「データ量」だけでなく「表現の通し方」に移っている点が重要である。約600時間の身体性事前学習データでRoboDojoの成績を示したことは、実機データをどう圧縮し、どの勾配を表現に流すかが学習効率と再利用性を左右することを示す。DINO特徴を起点にした点は、視覚基盤モデルの流用がそのまま制御性能につながらないことも示唆する。次に確認すべき論点は、RoboTwin 2.0とRoboDojo以外への汎化、600時間というデータ条件の感度、そしてAction-Grounded Representation Shapingが別タスクや別ロボットでも同様に働くかである。

なぜ重要か

論文は、生成動画の事前学習に頼らずにRoboTwin 2.0で93.6%の成功率を示したとしており、ロボット学習で必要なのが単なるデータ量ではなく表現設計である可能性を示す。約600時間の身体性事前学習データでRoboDojoの平均12.29、成功率8.28%を示した点は、実機データをどのように圧縮し勾配を流すかが性能条件になることを示している。