何が起きたか
CSWAMは2026-09-16、FastWAM型の世界行動モデルに因果的意味表現の専門家を加える手法として公表された。論文は、外観特有の細部に依存しやすい再構成志向の表現と、観測履歴の不足が、未知の दृश्यや物体での一般化を弱めると整理している。これに対し、V-JEPA 2.1を基盤にした専門家を組み込み、現在と過去の観測から得た文脈をビデオ系と行動系の両方に共有する構成を採る。
詳細
CSWAMは、因果的アテンションを用いて履歴由来の文脈をビデオストリームとアクションストリームへ共有しつつ、推論時には現在の動画状態と観測された意味履歴に条件づけて行動のデノイジングを行う。論文は、これによりaction-only inferenceの効率を保つとしている。 評価では、embodied pretrainingを用いた場合、RoboTwin 2.0のClean-to-Randomized transferにおけるRandomized successが10.16%から45.18%へ上昇し、FastWAMに対して35.02ポイント改善した。さらに、2つの実ロボット課題と3段階のOOD難度では、平均成功率が27.5%から70.0%へ改善し、差は42.5ポイントとされた。
Key Facts
| CSWAMはFastWAMを拡張し、V-JEPA 2.1に基づく因果的意味表現の専門家を加える手法である。 | [1] |
| 推論時もaction-only inferenceの効率を維持する設計である。 | [1] |
| RoboTwin 2.0 Clean-to-Randomized transferで、Randomized successは10.16%から45.18%に上昇した。 | [1] |
| FastWAM比の改善幅は35.02ポイントとされた。 | [1] |
| 2つの実ロボット課題と3段階のOOD難度で、平均成功率は27.5%から70.0%へ改善した。 | [1] |
本紙の見方
CSWAMの新しさは、FastWAM型の世界行動モデルに対して、単なる再構成や見た目依存の表現を足すのではなく、V-JEPA 2.1由来の意味的で時間整合的な表現を「履歴」として組み込み、分布外でも状態変化を見失いにくくした点にある。既定路線の延長は、あくまでaction-only inferenceの効率を保つ設計で、モデルを重くする方向ではない。つまり、推論効率と頑健性の両立を狙った改良である。 本紙の関連記事はないため、過去報道との連続性を直接たどる材料はない。ただし、論文中で示された数値からは、評価軸が単なる静的な認識精度ではなく、Clean-to-Randomized transferや実ロボットのOOD条件に置かれていることが分かる。ここから、世界モデルの価値が「学習済み環境でどれだけ当たるか」よりも、「未見の見た目やタスク変動で行動に結びつく状態変化を保てるか」に移っていると読める。 構造面では、入力となる現在の動画状態に、稀な履歴から抽出した意味的文脈を重ね、その上で行動をデノイズする流れになっている。これは、外観情報→意味表現→行動生成という鎖の中で、外観寄りの情報をそのまま使うのではなく、時間的に裏づけられた状態変化へ変換してから制御に渡す設計である。したがって、競争の焦点は、V-JEPA 2.1の表現品質だけでなく、どの程度少ない履歴で必要な文脈を保てるか、また実ロボットでその改善が再現するかに移る。 未確定の論点は、今回の数値がどの程度広いタスク群に一般化するか、embodied pretrainingの有無で改善幅がどこまで変わるか、そしてOOD難度3段階の各条件ごとの内訳である。論文要旨からは、どの失敗例がどの表現で解消されたかまでは読めないため、今後は失敗モード別の比較と、履歴長や計算量とのトレードオフの確認が焦点になる。
なぜ重要か
論文が示したのは、分布外の視覚変化に対して、外観そのものではなく意味的な状態変化を履歴つきで扱う方が、実ロボットの成功率改善につながり得るという点である。FastWAM比でRoboTwin 2.0のRandomized successが10.16%から45.18%に上がったことは、学習済み見た目に依存する制御の限界を示す材料になる。