何が起きたか
arXivに公開された論文(ID: 2608.04692v1)で、マルチタスクの視覚言語行動(VLA)ポリシーに対するスキル単位のタスクベクトル減算の影響を、閉ループのターゲット・コントロール監査を用いて評価した。10のLIBERO-Goalスキルすべてで減算を実施し、その結果、5つのスキルでターゲットとコントロールの分離、3つで抵抗、2つで全体的な崩壊という3つの質的に異なる結果が得られた。保持された初期状態では、抑制可能な5つのターゲットは成功率0%を維持したが、ベースライン正規化後のコントロール保持率の平均は52%にとどまり、各ターゲット抑制編集は少なくとも1つの無関係なコントロールに実質的な悪影響を与えた。追加のGoalパネルでは、連続回帰、離散トークン、フローマッチングのアクションヘッドを持つポリシーで分離が見られた一方、Spatialパネルでは明確な分離は見られず、ObjectおよびLong-horizonパネルではコントロールの崩壊が観察された。平均タスクベクトルコサインはこの変動を説明しなかった。マッチドノルムコントロールは、1つのGoalアンカー周辺で局所的な符号非対称性を特定し、マルチベクトル結果はアンカーとスケールに依存して変化した。保持認識勾配ベースラインはデータ依存の比較対象を提供するが、除去時データと最適化を必要とし、減算は編集時点ではデータ・勾配フリーである(事前計算された専門家デルタを前提とする)。最後に、単一スキルの再学習プローブは、認定されたアンラーニングではなく、行動マスキングと整合的であった。
Key Facts
| arXivに公開された論文(ID: 2608.04692v1)で、マルチタスクの視覚言語行動(VLA)ポリシーに対するスキル単位のタスクベクトル減算の影響を評価した。 | [0] |
| 10のLIBERO-Goalスキルすべてで減算を実施し、5つのスキルでターゲットとコントロールの分離、3つで抵抗、2つで全体的な崩壊が観察された。 | [0] |
| 保持された初期状態では、抑制可能な5つのターゲットは成功率0%を維持したが、ベースライン正規化後のコントロール保持率の平均は52%だった。 | [0] |
| 各ターゲット抑制編集は、少なくとも1つの無関係なコントロールに実質的な悪影響を与えた。 | [0] |
| 追加のGoalパネルでは、連続回帰、離散トークン、フローマッチングのアクションヘッドを持つポリシーで分離が見られた。 | [0] |
| Spatialパネルでは明確な分離は見られず、ObjectおよびLong-horizonパネルではコントロールの崩壊が観察された。 | [0] |
| 平均タスクベクトルコサインはこの変動を説明しなかった。 | [0] |
| マッチドノルムコントロールは、1つのGoalアンカー周辺で局所的な符号非対称性を特定した。 | [0] |
| マルチベクトル結果はアンカーとスケールに依存して変化した。 | [0] |
| 保持認識勾配ベースラインはデータ依存の比較対象を提供するが、除去時データと最適化を必要とする。 | [0] |
| 減算は編集時点ではデータ・勾配フリーである(事前計算された専門家デルタを前提とする)。 | [0] |
| 単一スキルの再学習プローブは、認定されたアンラーニングではなく、行動マスキングと整合的であった。 | [0] |
なぜ重要か
この研究は、タスクベクトル減算が高速だが脆弱な介入であることを示し、組み込みモデル編集における局所性を評価する際に、閉ループのターゲット・コントロール評価の必要性を強調している。