何が起きたか

arXivに公開された論文(ID: 2608.04692v1)で、マルチタスクの視覚言語行動(VLA)ポリシーに対するスキル単位のタスクベクトル減算の影響を、閉ループのターゲット・コントロール監査を用いて評価した。10のLIBERO-Goalスキルすべてで減算を実施し、その結果、5つのスキルでターゲットとコントロールの分離、3つで抵抗、2つで全体的な崩壊という3つの質的に異なる結果が得られた。保持された初期状態では、抑制可能な5つのターゲットは成功率0%を維持したが、ベースライン正規化後のコントロール保持率の平均は52%にとどまり、各ターゲット抑制編集は少なくとも1つの無関係なコントロールに実質的な悪影響を与えた。追加のGoalパネルでは、連続回帰、離散トークン、フローマッチングのアクションヘッドを持つポリシーで分離が見られた一方、Spatialパネルでは明確な分離は見られず、ObjectおよびLong-horizonパネルではコントロールの崩壊が観察された。平均タスクベクトルコサインはこの変動を説明しなかった。マッチドノルムコントロールは、1つのGoalアンカー周辺で局所的な符号非対称性を特定し、マルチベクトル結果はアンカーとスケールに依存して変化した。保持認識勾配ベースラインはデータ依存の比較対象を提供するが、除去時データと最適化を必要とし、減算は編集時点ではデータ・勾配フリーである(事前計算された専門家デルタを前提とする)。最後に、単一スキルの再学習プローブは、認定されたアンラーニングではなく、行動マスキングと整合的であった。

Key Facts

arXivに公開された論文(ID: 2608.04692v1)で、マルチタスクの視覚言語行動(VLA)ポリシーに対するスキル単位のタスクベクトル減算の影響を評価した。[0]
10のLIBERO-Goalスキルすべてで減算を実施し、5つのスキルでターゲットとコントロールの分離、3つで抵抗、2つで全体的な崩壊が観察された。[0]
保持された初期状態では、抑制可能な5つのターゲットは成功率0%を維持したが、ベースライン正規化後のコントロール保持率の平均は52%だった。[0]
各ターゲット抑制編集は、少なくとも1つの無関係なコントロールに実質的な悪影響を与えた。[0]
追加のGoalパネルでは、連続回帰、離散トークン、フローマッチングのアクションヘッドを持つポリシーで分離が見られた。[0]
Spatialパネルでは明確な分離は見られず、ObjectおよびLong-horizonパネルではコントロールの崩壊が観察された。[0]
平均タスクベクトルコサインはこの変動を説明しなかった。[0]
マッチドノルムコントロールは、1つのGoalアンカー周辺で局所的な符号非対称性を特定した。[0]
マルチベクトル結果はアンカーとスケールに依存して変化した。[0]
保持認識勾配ベースラインはデータ依存の比較対象を提供するが、除去時データと最適化を必要とする。[0]
減算は編集時点ではデータ・勾配フリーである(事前計算された専門家デルタを前提とする)。[0]
単一スキルの再学習プローブは、認定されたアンラーニングではなく、行動マスキングと整合的であった。[0]

なぜ重要か

この研究は、タスクベクトル減算が高速だが脆弱な介入であることを示し、組み込みモデル編集における局所性を評価する際に、閉ループのターゲット・コントロール評価の必要性を強調している。