何が起きたか
2026年6月7日にarXivで公開された論文「FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning」が、VLAポリシーの微調整における視覚残差の崩壊を防ぐ訓練時目的関数FiberTuneを提案した。同手法は、オンライン行動プローブを用いて行動予測的な特徴方向を推定し、中間視覚トークン表現からフィルタリングした後、凍結した視覚教師に整列させる。
詳細
FiberTuneは、行動教師あり微調整が予測行動を変える方向のみを制約し、行動等価な状態間で一貫した視覚構造を崩壊させる問題を「局所行動ファイバーに沿った残差視覚崩壊」と形式化する。提案手法は、オンライン行動プローブで行動予測的な特徴方向を推定し、中間視覚トークン表現からフィルタリングし、プローブフィルタリング済み残差を凍結視覚教師に整列させつつ、その実効ランクを正則化する。同一訓練条件下で、2つのベンチマークと2つのアーキテクチャ(pi_0.5とOpenVLA-OFT)にわたる6つの制御シミュレーション設定すべてでタスク損失のみの微調整を上回り、長 horizon CALVIN ABC-to-DではSR(5)が+10.7パーセントポイント向上、物理SO-101のタスク成功率は72.7%から78.1%に向上した。残差診断では、これらの向上はプローブフィルタリング済み残差の教師整列と実効ランクの増加と一致し、行動ファイバーの動機と整合する。
Key Facts
| FiberTuneは、VLAポリシーの微調整における視覚残差の崩壊を防ぐ訓練時目的関数であり、推論時のオーバーヘッドを追加しない。 | [1] |
| FiberTuneは、オンライン行動プローブで行動予測的な特徴方向を推定し、中間視覚トークン表現からフィルタリングし、プローブフィルタリング済み残差を凍結視覚教師に整列させ、実効ランクを正則化する。 | [1] |
| 同一訓練条件下で、FiberTuneは6つの制御シミュレーション設定すべてでタスク損失のみの微調整を上回った。 | [1] |
| 物理SO-101のタスク成功率は72.7%から78.1%に向上した。 | [1] |
| 長 horizon CALVIN ABC-to-DではSR(5)が+10.7パーセントポイント向上した。 | [1] |
なぜ重要か
VLAモデルの微調整はロボット学習の主要な手法だが、視覚表現の崩壊が性能の頭打ちを招く可能性がある。FiberTuneはこの問題を軽減する手法として、実ロボットでの成功率向上を示した。ロボット学習の実用化に向け、視覚と行動のバランスを保つ設計指針を提供する点で重要である。