何が起きたか

arXivは2026-10-05、VLA(vision-language-action)モデルの事後学習におけるデータ拡張の使い方を扱う論文を掲載した。論文は、強化学習(RL)の更新ではcriticモジュールのみに画像拡張を適用し、actorの入力はロールアウト時と更新時の両方でクリーンに保つことが重要だと結論づけた。対象モデルのπ0.5とGR00T N1.5では、LIBERO-PlusでのOOD成功率がそれぞれ7.8ポイント、10.0ポイント改善したとしている。

詳細

論文は、画像拡張の種類と強さを変えながら、VLAの事後学習への影響を系統的に検証した。結果として、actor側に拡張をかけると学習が完全に崩壊した一方、critic側のみへの拡張では一般化性能が改善したと報告している。 本論文が示した実務上の推奨は、RL更新時にcriticへだけ拡張をかけ、actorの入力は一貫してクリーンに保つことだ。評価指標としてはLIBERO-PlusのOOD成功率が用いられ、π0.5では7.8ポイント、GR00T N1.5では10.0ポイントの上昇が示された。

Key Facts

arXivは2026-10-05に論文『How (and How Not) to Use Data Augmentation in VLA Post-Training』を掲載した。[1]
論文はVLA(vision-language-action)モデルの事後学習における画像拡張の使い方を検証した。[1]
強化学習の更新ではcriticモジュールのみに画像拡張を適用し、actorの入力はロールアウト時と更新時の両方でクリーンに保つべきだとした。[1]
π0.5ではLIBERO-PlusのOOD成功率が7.8ポイント上昇した。[1]
GR00T N1.5ではLIBERO-PlusのOOD成功率が10.0ポイント上昇した。[1]

本紙の見方

この論文の新規性は、VLAの事後学習におけるデータ拡張を「入れるか入れないか」ではなく、「actorとcriticのどちらに、どの局面で入れるか」という粒度で切り分けた点にある。単なる正則化の推奨ではなく、RL更新の役割分担そのものに踏み込んでいる。特に、actorに拡張をかけると学習が崩壊し、criticのみなら一般化が改善したという対照は、拡張が一様に有効ではないことを示している。 本紙の関連記事はないため、過去報道との連続性は置けないが、論文の位置づけとしては、VLAの汎化改善をRL事後学習で詰める流れの中にある。ここで重要なのは、画像拡張が「視覚入力の多様化」という一般論ではなく、方策生成側のactorと評価側のcriticで意味が異なる点である。actorの入力を汚すと学習全体が壊れる一方、criticのみの拡張は不確実な視覚変化への耐性づくりに寄与したと読める。 業界構造への含意としては、VLAの性能競争がモデル規模だけでなく、事後学習の設計に移っていることがうかがえる。データ拡張、RLの更新先、ベンチマーク設定が一体で効くため、学習パイプラインの設計ミスが性能差として表れやすい。π0.5とGR00T N1.5で同方向の改善が出た点は、特定モデル固有の偶然ではなく、事後学習の手順として再現性を持つ可能性を示すが、適用範囲はなお限定的だとみられる。 次に確認すべき論点は、どの拡張種別と強さが最適なのか、LIBERO-Plus以外の環境でも同じ規則が成り立つのか、そしてactorをクリーンに保つ要件が他のVLAや別のRL設定でも維持されるのかである。論文は一般化改善を示したが、実運用ではタスク分布や視覚ノイズの条件次第で再現性の確認が必要になる。

なぜ重要か

VLAを実装する研究者や開発者にとって、画像拡張をどこに掛けるかが学習成否を左右する可能性が示された。論文ではπ0.5とGR00T N1.5の両方でLIBERO-PlusのOOD成功率が改善し、少なくともこの設定ではcritic側のみの拡張が有効だったとしている。 一方で、actor側への拡張は学習崩壊につながったため、従来の「拡張を増やせば汎化が上がる」という扱いは危うい。事後学習の設計条件を誤ると、性能向上ではなく学習不能に転ぶ点が重要だ。