何が起きたか
arXivは2026-09-27、Vision-Language-Action(VLA)エキスパートを共有の行動インターフェースで統合する論文「Train Together or Merge Later? Unifying VLA Experts via a Shared Action Interface」を公開した。論文は、個別に学習したエキスパートをそのままマージしても、task-specificな行動正規化やaction encoder/decoderの差が干渉要因になると指摘する。提案手法PolicyWeaveは、共有のaction interfaceを保ったままpost-trainingを行い、さらに文脈に基づく疎な重み付きマージで更新を選別する。
詳細
論文では、post-training時に全エキスパートが共通のbase policyのaction interfaceを維持し、task適応はaction modelのhidden layersに対するLoRA更新に限定する設計を採った。マージ段階では、初期の視覚・言語コンテキストを使って各エキスパートのLoRA更新を採点し、leave-one-layer-outの順位安定性で選んだエキスパート集合を、現在タスクに対して固定された疎な加重マージとして組み合わせる。 評価はGR00T N1.5を用い、18のRoboCasa365タスクで実施した。ターゲットタスクのデモンストレーションは10%だけを使ってsupervised fine-tuning(SFT)し、共有action interfaceを保つことで4つの静的マージ手法の平均成功率は17.0%から52.8%に上昇した。PolicyWeaveはSFTのエキスパートで64.7%の成功率を示し、task-specific reinforcement learning(RL)後は74.1%となり、joint RLの60.7%を上回った。さらにLIBERO-10とAgileX Piper armでも評価し、長い行動列と実機操作で独立に学んだスキルの展開可能性を示した。
Key Facts
| arXivは2026-09-27に論文「Train Together or Merge Later? Unifying VLA Experts via a Shared Action Interface」を公開した。 | [1] |
| 提案手法はPolicyWeaveで、共有のaction interfaceを保ったままpost-trainingし、context-guided sparse mergingを組み合わせる。 | [1] |
| task-specificな変更点として、action normalizationとaction encoder/decoderが干渉要因だと論文は述べている。 | [1] |
| GR00T N1.5を用いた18のRoboCasa365タスクで評価した。 | [1] |
| 共有action interfaceを維持した結果、4つの静的マージ手法の平均成功率は17.0%から52.8%に上昇した。 | [1] |
本紙の見方
この論文の新規性は、VLAの性能を単に「どのエキスパートを学習したか」ではなく、「行動インターフェースをどう揃えてから統合するか」に置いた点にある。個別学習の強みを残しながらモデルをマージする発想自体は既定路線だが、ここではaction normalizationとaction encoder/decoderの差がマージ不整合の原因だと切り分け、その後段でLoRA更新のみを扱うことで互換性を高めている。つまり、学習済み能力の足し算よりも、入力から出力までの接合面を標準化する設計が主題である。 本紙の関連記事は与えられていないため、過去報道との連続性は置けない。ただし記事として見るべき焦点は、RoboCasa365の18タスクという比較的限定された評価系で、10%のデモンストレーションしか使わないSFT条件でも、静的マージの平均成功率が17.0%から52.8%へ跳ねた点にある。ここから読めるのは、エキスパート数そのものよりも、行動表現の整合性がマージ可否を左右するという構造だ。さらに、SFT後の64.7%からtask-specific RL後の74.1%まで伸びているため、マージで土台を作り、RLで詰める二段構えが有効だったとみられる。 業界構造への含意としては、VLAの開発競争が「単一の巨大モデルを作る」方向だけではなく、モジュール化した専門家をどう再結合するかに移りつつあることを示す。とくにaction interfaceを共通化すれば、異なるtaskで学んだ重みを再利用しやすくなり、実機ロボットのタスク移植や長期行動への展開で再学習コストを下げる可能性がある。他方で、論文自体が示している通り、すべてのエキスパートを一括で混ぜればよいわけではなく、干渉の強い更新をどう除外するかが残る。今後確認すべき論点は、GR00T N1.5以外の基盤モデルでも同じ効果が出るか、LIBERO-10やAgileX Piper armでの評価がどの程度一般化するか、そして実運用で必要になるマージの更新頻度や計算コストである。
なぜ重要か
この論文は、ロボット向けVLAで「学習したスキルを統合して再利用する」際の前提条件を、action interfaceの共通化として具体化した点に意味がある。発表元であるarXivの本文では、18タスクの評価で静的マージの平均成功率が17.0%から52.8%に上がり、task-specific RL後に74.1%へ達したとされており、再学習の一部を統合設計で代替できる可能性が示されている。