何が起きたか

arXivに2026-09-30付で掲載された論文で、Vision-Language-Action(VLA)モデル向けのMotionWeaveが提案された。手法は、Action-Induced Motion Grounder(AIMG)とHorizon Residual Composer(HRC)の2モジュールで、未来の各時刻に対応する動きの局所領域を現在の視覚トークンから位置付け、時間差分のモーション手掛かりを行動トークンへ注入する設計である。MetaWorldの6課題では平均成功率75.3%を記録し、π0の66.7%を8.6ポイント上回った。

詳細

AIMGは行動と固有受容感覚の表現に条件づけて、各未来時刻ごとのクエリを構成し、現在の視覚トークンから相互作用領域を局所化する。HRCは隣接するホライズン間の相互作用表現の差分を抽出して時間的なモーション手掛かりとして符号化し、ゲート付き残差で行動トークンへ組み込む。 学習時には未来フレームからレンダリングしたロボットアームのマスクを用いて、KLベースのモーション・グラウンディング監督を構築する一方、推論時は現在の観測のみを使う。論文ではコードをGitHubで公開しているとしている。

Key Facts

MotionWeaveはVision-Language-Action(VLA)モデル向けの未来動作中心フレームワークである。[1]
構成要素はAction-Induced Motion Grounder(AIMG)とHorizon Residual Composer(HRC)の2モジュールである。[1]
学習時には未来フレームからレンダリングしたロボットアームマスクを使い、KLベースのモーション・グラウンディング監督を与える。[1]
推論時は現在の観測のみを入力として用いる。[1]
MetaWorldの6課題で平均成功率75.3%を示し、π0の66.7%を8.6ポイント上回った。[1]

本紙の見方

MotionWeaveの新しさは、VLAに世界モデル的な未来表現を足すという方向性そのものではなく、未来画像や動画の全面予測を避けつつ、動きに関係する部分だけを学習信号にする点にある。論文は、外観情報を広く当てにいくのではなく、AIMGで各未来時刻の相互作用領域を現在の視覚トークンから切り出し、HRCで隣接ホライズン差分をモーション手掛かりとして再注入する構造を採る。つまり、入力→局所化→時系列差分→行動トークンへの反映、という連結に焦点が置かれており、画像生成寄りの世界モデルとは設計思想が異なる。 本紙の関連記事はないため、過去報道との連続性は置かない。公開情報として確認できるのは、推論時に現在の観測だけを使うことと、学習時に未来フレーム由来のロボットアームマスクでKLベースの監督を与えることだ。この非対称な学習・推論設計は、未来を直接出力する方式よりも、制御に必要な動き情報にだけ損失を集中させる狙いが読み取れる一方、何を動きとして切り出すかの品質が性能を左右しやすい。MetaWorldの6課題で平均75.3%という結果は、その設計が少なくとも限定されたベンチマークでは有効だったことを示す。 業界構造への含意としては、VLAの性能差が単純なモデル規模だけでなく、どの中間表現を監督するかに移りつつある点が大きい。AIMGは視覚トークンと行動・固有受容感覚の整合、HRCは時間差分の符号化と残差注入を担当するため、学習データ側には各時刻の相互作用を示す情報が必要になる。ここで効くのは、未来フレームそのものの再現性より、局所的な接触・操作の表現精度である。次に確認すべきなのは、6課題以外での再現性、ロボットアーム以外への一般化、KL監督に使うマスク生成の条件、そしてコード公開後に実装差で性能がどれだけ変わるかである。

なぜ重要か

推論時に現在の観測だけを使いながら、学習時には未来フレーム由来のマスクで動きの監督を与える設計は、制御系で必要な情報をどこに集約するかを具体化している。MetaWorldの6課題で75.3%とπ0比8.6ポイント高い結果は、VLAの改善余地が単なる出力精度ではなく、モーション表現の与え方にある可能性を示す。