何が起きたか
arXivに2026年9月25日付で掲載された論文「InternW0-$Δ$」は、World Action Models(WAMs)として、視覚的ダイナミクスと行動生成を一体化する手法を提案した。論文では、Mixture-of-Transformers(MoT)を用いて、事前学習済みの動画エキスパート、行動エキスパート、凍結したVLM、さらに訓練時のみ蒸留される4D基盤モデルを組み合わせる。学習データはロボット実演、UMIデータ、エゴセントリック人間実演、Ego2Robotデータを共通の状態-行動表現にそろえて構成し、処理済みで20K時間超に達した。
詳細
論文は、推論時に未来動画のロールアウトを使わず、訓練時の未来監督から未来に関連する場面変化を学ぶ「Causal Imprint」を導入したとしている。また、公開可能なライセンスの範囲で、学習コード、モデル重み、インフラ、データ処理パイプライン、処理済みデータをオープンソース化するとしている。 著者らは、構築したコーパスについて「同種の公開ソースとしては最大」と位置づけているが、学習台数や実機の導入先ではなく、データ処理とモデル統合の設計が主眼である。
Key Facts
| 論文名は「InternW0-$Δ$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data」である。 | [1] |
| 掲載日は2026-09-25である。 | [1] |
| World Action Models(WAMs)として、視覚的ダイナミクスと行動生成を統合する枠組みを扱う。 | [1] |
| Mixture-of-Transformers(MoT)フレームワークを用い、動画エキスパート、行動エキスパート、凍結したVLM、4D基盤モデルを組み合わせる。 | [1] |
| 学習コーパスはロボット実演、UMIデータ、エゴセントリック人間実演、Ego2Robotデータで構成され、処理済みで20K時間超である。 | [1] |
本紙の見方
この論文の新規性は、ロボット操作の「見て予測する」部分と「動かす」部分を、別系統の事前知識を保ったままMoTで束ねた点にある。単に大規模データで学習したというより、動画のダイナミクス、場面意味、4D幾何・運動、行動生成を役割分担させているため、モデルの中で何を予測し、何を行動に渡すかが設計の中心になっている。これは、巨大な単一モデルで全てを吸収するやり方とは異なり、実世界操作で必要な知識を分離して持ち込む構成だと読める。 本紙の過去報道に接続する材料はないため、今回は論文内で完結する整理になる。注目点は、推論時に未来動画を展開しない「Causal Imprint」を置いたことだ。未来監督は訓練時にのみ使い、実運用では予測表現を行動エキスパートへ直接渡すため、実時間制約のある操作系では計算経路の短縮が焦点になる。ただし、論文は実機プラットフォームでの性能向上を示す一方、どの操作タスクでどの程度一般化したか、失敗例がどこに残るかまではこの要約だけでは詰め切れない。 業界構造としては、ロボット操作AIの競争軸が「モデルサイズ」だけでなく、「どのデータを、どの表現にそろえて、推論時に何を省くか」に移っていることを示す。20K時間超の公開コーパスは、学習データの量だけでなく、ロボット実演、UMI、人体視点、人間実演、Ego2Robotを共通表現へ整える処理系そのものが価値になることを示唆する。つまり入力データの収集よりも、状態-行動表現への整列と蒸留・融合の設計が、再現性と性能差を生む可能性がある。未確定の論点は、公開予定のコードと重みがどこまで再学習可能性を担保するか、20K時間超の処理済みデータが実タスクの失敗率や安全性にどう効くか、そして実機評価でどの環境差が残るかである。
なぜ重要か
論文は、20K時間超の処理済みデータと、動画・意味・幾何・行動を分けて束ねる設計を公表しており、ロボット操作AIの学習単位を「生データの量」から「表現の整列方法」へ移す可能性がある。著者らは学習コード、モデル重み、データ処理パイプラインの公開方針も示しており、再現性を確認できるかが実務上の焦点になる。