何が起きたか

arxiv.org が2026-09-18に公開した論文「FAN: Foresight Action Normalization for Continual Adaptation of Vision-Language-Action Models」は、継続的に新しい技能を獲得しながら既習能力を保持するVLAモデル向けに、FAN(foresight action normalization)を提案した。著者らは、単腕と両腕の操作を含む4つの実世界タスク系列で、5種類の正規化戦略を比較している。論文は、既存の継続VLA適応で見落とされてきた基礎機構として action normalization を位置づけ、その座標系のずれを主要論点として扱っている。

詳細

論文は、既存プロトコルがタスク間の座標ドリフト、動作範囲の不足、学習時と評価時の座標不一致によって深刻な失敗モードを招くと整理した。そのうえで、整合性(consistency)、被覆性(coverage)、因果性(causality)という3Cの設計原則を導き、FANを定式化している。 FANは、継続学習の前に小さなタスク非依存の校正集合から正規化統計を一度だけ推定し、その値を適応中ずっと固定する。論文は、評価したすべての系列でFANが最高性能を示し、安定した頑健性を示したとしている。

Key Facts

論文名は「FAN: Foresight Action Normalization for Continual Adaptation of Vision-Language-Action Models」である。[1]
掲載日は2026-09-18である。[1]
対象は vision-language-action(VLA)モデルの継続適応である。[1]
単腕と両腕の操作を含む4つの実世界タスク系列で評価した。[1]
5種類の正規化戦略を比較し、FANは小さなタスク非依存の校正集合から正規化統計を1回推定して固定する。[1]

本紙の見方

今回の論文の新しさは、継続学習の工夫として経験再生や強化学習の再調整を追加するのではなく、行動を表す座標系そのもの、すなわち action normalization を主題に据えた点にある。VLAモデルの長期運用では新技能の獲得と既習技能の保持を両立させる必要があるが、本論文はその破綻要因をパラメータ更新量ではなく、タスク間でずれる正規化統計に見いだしている。ここでのFANは、適応時に都度合わせる方式ではなく、事前の小規模校正で統計を固定する設計であり、学習手順の変更というより表現座標の安定化を狙う点が特徴である。 本紙の過去報道は与えられていないため、連続性の比較はできない。ただ、論文本文からは、既存の継続VLA適応が「経験再生」「reinforcement fine-tuning」を用いてきた一方で、正規化の設計原理が十分に扱われていなかったという問題設定が読み取れる。つまり、改善対象はモデル容量やデータ量の増加ではなく、単腕・両腕の両方で共通に使える動作表現の安定性だとみられる。4つの実世界タスク系列と5つの正規化戦略を比較した点は、単一タスクの精度ではなく、系列をまたぐ座標整合を評価軸に置いたことを示している。 業界構造への含意としては、VLAの実運用で重要になるのは、どのロボットが何をできるかだけでなく、その動作を記述する内部座標をどう共通化し、更新しても壊れない形に保つかである。FANのようにタスク非依存の校正集合を使う方式は、学習データの追加より先に、データの座標合わせを工程として切り出す発想であり、後段の継続学習の安定度を左右する可能性がある。もっとも、論文が示したのは4系列での評価結果までであり、どの程度のデータ規模で校正が成立するのか、別種のロボットやより長い運用で同じ固定戦略が保てるのかは未確定である。また、5種類の正規化戦略の具体差や、失敗モードの再現条件がどの程度一般化するかも、今後の検証点になる。

なぜ重要か

VLAモデルを実機で継続運用する際、学習の継ぎ足しだけではなく、動作座標の不一致が性能低下の要因になりうることを、論文は4つの実世界タスク系列の比較で示している。FANは小さなタスク非依存の校正集合で統計を固定するため、継続学習の前処理として何を標準化するかが重要になる。