何が起きたか
2026年6月7日にarXivで公開された論文「FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning」が、VLAポリシーの微調整における視覚残差の崩壊を防ぐ訓練時目的関数FiberTuneを提案した。同手法は、オンライン行動プローブを用いて行動予測的な特徴方向を推定し、中間視覚トークン表現からフィルタリングした後、凍結した視覚教師に整列させる。
詳細
FiberTuneは、行動教師あり微調整が予測行動を変える方向のみを制約し、行動等価な状態間で一貫した視覚構造を崩壊させる問題を「局所行動ファイバーに沿った残差視覚崩壊」と形式化する。提案手法は、オンライン行動プローブで行動予測的な特徴方向を推定し、中間視覚トークン表現からフィルタリングし、プローブフィルタリング済み残差を凍結視覚教師に整列させつつ、その実効ランクを正則化する。同一訓練条件下で、2つのベンチマークと2つのアーキテクチャ(pi_0.5とOpenVLA-OFT)にわたる6つの制御シミュレーション設定すべてでタスク損失のみの微調整を上回り、長 horizon CALVIN ABC-to-DではSR(5)が+10.7パーセントポイント向上、物理SO-101のタスク成功率は72.7%から78.1%に向上した。残差診断では、これらの向上はプローブフィルタリング済み残差の教師整列と実効ランクの増加と一致し、行動ファイバーの動機と整合する。
Key Facts
| FiberTuneは、VLAポリシーの微調整における視覚残差の崩壊を防ぐ訓練時目的関数であり、推論時のオーバーヘッドを追加しない。 | 出典一覧 |
| FiberTuneは、オンライン行動プローブで行動予測的な特徴方向を推定し、中間視覚トークン表現からフィルタリングし、プローブフィルタリング済み残差を凍結視覚教師に整列させ、実効ランクを正則化する。 | 出典一覧 |
| 同一訓練条件下で、FiberTuneは6つの制御シミュレーション設定すべてでタスク損失のみの微調整を上回った。 | 出典一覧 |
| 物理SO-101のタスク成功率は72.7%から78.1%に向上した。 | 出典一覧 |
| 長 horizon CALVIN ABC-to-DではSR(5)が+10.7パーセントポイント向上した。 | 出典一覧 |
本紙の見方
今回の提案は、VLAモデルの微調整における視覚表現の劣化という、これまで明示的に扱われてこなかった問題に切り込んだ点で新規性がある。行動教師あり学習は、行動予測に寄与する方向のみを制約するため、行動が変わらない状態間で視覚特徴が崩壊しやすい。FiberTuneはこの「残差視覚崩壊」を定式化し、行動プローブで推定した方向を除去した残差を視覚教師に整列させることで、視覚構造の維持を図る。推論時オーバーヘッドを追加しない設計は実用性が高く、シミュレーション6設定すべてで改善した点は頑健性を示す。ただし、対象はpi_0.5とOpenVLA-OFTの2アーキテクチャに限られ、物理ロボットでの検証はSO-101の1タスクのみである。また、提案手法は訓練時の計算コスト増加を伴う可能性があり、そのトレードオフは未評価である。業界への含意としては、VLAモデルの実ロボット応用において、視覚表現の維持がタスク成功率に直結することを示唆する。今後は、より多様なタスクやアーキテクチャでの検証、訓練コストの定量化、長期的な学習安定性への影響が焦点になる。
なぜ重要か
VLAモデルの微調整はロボット学習の主要な手法だが、視覚表現の崩壊が性能の頭打ちを招く可能性がある。FiberTuneはこの問題を軽減する手法として、実ロボットでの成功率向上を示した。ロボット学習の実用化に向け、視覚と行動のバランスを保つ設計指針を提供する点で重要である。