何が起きたか
arXivに2026-09-25付で掲載された論文で、Instruction Switching in VLA Policiesに対する訓練不要の推論時介入「Causeway」が示された。VLAは標準初期状態からは多くのタスクをこなせる一方、別タスクの実行後に新しい指示を与えると、対象タスクが実行不能になる場合があるとしている。論文は、71のcross-object pair、3つの切り替えタイミング、3つのVLAアーキテクチャを用いたLIBERO-Goalの評価で、裸の切り替え成功率を3〜26%から47〜65%へ改善した。
詳細
Causewayは、現在状態とターゲットタスクのre-entry poseを与え、凍結された復号計算を通じて逆伝播し、action-stream表現内にstate-directed writeを適用する方式である。論文によれば、VLAは復帰動作を自ら復号し、パラメータ更新、新しいaction head、外部のaction generationを必要としない。 追加実験として、LIBERO-Objectと実機のxArmプラットフォームでも回復が確認されており、主設定のLIBERO-Goalに限らず回復が及ぶとされる。
Key Facts
| Causewayは、VLA Policiesのinstruction switchingに対するtraining-free inference-time interventionである。 | [1] |
| 手法は、現在状態とre-entry poseを用い、frozen decoding computationをback-propagateしてaction-stream representationにstate-directed writeを行う。 | [1] |
| パラメータ更新、新しいaction head、external action generationを必要としないとされる。 | [1] |
| LIBERO-Goalで、71のcross-object pairs、3つのswitch timings、3つのVLA architecturesを評価した。 | [1] |
| bare-switch successは3-26%から47-65%に上昇し、handoff neighborhood到達率は42-72 percentage points改善した。 | [1] |
本紙の見方
Causewayの新規性は、VLA方策の再学習ではなく、切り替え時の推論経路そのものを介入点にしたところにある。既存のVLAは標準初期状態でのタスク遂行を前提に設計されがちだが、この論文は、前のタスクで物理状態が変化した後には同じ方策でも対象タスクが到達不能になることを示し、その隙間を「task islands」と名付けている。つまり論点は、認識や行動生成の精度そのものではなく、状態遷移後の再 प्रवेश性にある。 本紙の過去報道はないが、今回の結果は「新しいモデルを足す」のではなく「既存モデルの復号をどう使うか」を変える点で、VLAの改良方向を分けて考える必要があることを示す。パラメータ更新なし、action head追加なし、外部行動生成なしという設計は、学習コストや実装複雑性を抑えつつ、切り替え時の失敗を補う狙いと読める。一方で、効いているのはLIBERO-Goalの71組・3タイミング・3アーキテクチャという評価枠内であり、どの程度一般のロボット操作や長いタスク連鎖に伸びるかはまだ限定的だ。 業界構造への含意としては、VLAの競争軸が単純なベンチマーク成功率から、タスク変更後の再開性・復帰性へ広がる可能性がある。とくに実機xArmでの結果は、シミュレーション上の補正ではなく、物理状態が変わった後の再実行を評価軸に置く必要を示している。ただし、論文が示したのは回復の有無と成功率であり、計算負荷、応答遅延、対象動作の範囲、どの種類のtask islandsに弱いかは本文からは読み切れない。今後は、より長い指示列、別環境、異なるロボットでの再現性が確認点になる。
なぜ重要か
この手法は、別タスク後の状態からでも対象タスクに戻れるかを改善する点で、指示切り替えを前提にしたロボット制御に関係する。論文は、LIBERO-GoalとxArm実機の両方で回復を示しており、少なくともシミュレーション専用の結果ではない。