何が起きたか
研究チームは2026年5月19日にarXivで論文を公開し、最適化器Muonが事前学習後のVLA訓練とRLVRで根本的な限界を持つことを明らかにした。その解決策として、高域通過NS反復を特徴とするPionを提案し、シミュレーションと実ロボットで性能を実証した。
詳細
Muonは、Newton-Schulz反復を用いて運動量行列の特異値を1に近づけることでスペクトル勾配の直交化を実現する行列認識型最適化器である。しかし、低ランクなアクションモジュール勾配や低SNR勾配が存在するVLA訓練やRLVRでは、一様なスペクトル白色化が不安定になる。Pionは、この一様な白色化を、支配的な特異値を1に固定しノイズ成分を0に抑える2段階の促進・抑制機構に置き換える。さらに、注意ヘッドごとに独立して更新を適用するパーヘッドモードを追加コストなしでサポートする。実験では、LIBEROおよびLIBERO-PlusでのVLA訓練において、PionはVLA-AdapterとVLANeXtの両方でベースラインを上回り、VLA-AdapterでLIBERO Objectの成功率100%を達成した(Muonは97.0%、AdamWは32.2%)。また、pi_0.5バックボーンを用いたFranka Research 3ロボットによるDROIDセットアップの3つの把持配置タスクでも優位性を示した。RLVRでは、Qwen3-1.7B/4BでGRPOとGMPOを用いた事後訓練において、PionはMATHとGSM8KでAdamWを上回り、Muonはゼロに崩壊した。
Key Facts
| MuonはNewton-Schulz反復を用いて運動量行列の特異値を1に近づける行列認識型最適化器である。 | 出典一覧 |
| Pionは高域通過NS反復を導入し、支配的な特異値を1に固定しノイズ成分を0に抑える。 | 出典一覧 |
| LIBERO ObjectでPionはVLA-Adapterで100%の成功率を達成し、Muonは97.0%、AdamWは32.2%だった。 | 出典一覧 |
| PionはFranka Research 3ロボットとpi_0.5バックボーンを用いたDROIDセットアップの3つの把持配置タスクで優位性を示した。 | 出典一覧 |
| RLVRでPionはQwen3-1.7B/4BでMATHとGSM8KでAdamWを上回り、Muonはゼロに崩壊した。 | 出典一覧 |
本紙の見方
本論文の位置づけは、最適化器の設計が事前学習と事後学習で異なる要件を持つことを明確にした点にある。MuonはLLM事前学習でAdamWを上回る一方、VLAやRLVRではスペクトル白色化がノイズ増幅や特異値の不安定化を招く。Pionは高域通過フィルタにより、支配的な方向を維持しつつノイズを抑制する設計で、この問題を解決する。これは、最適化器の選択がタスクの性質に依存することを示唆し、今後の基盤モデル開発において重要な指針となる。特に、ロボット操作のような低ランクな勾配構造を持つタスクでは、一様な白色化が逆効果になる可能性があり、Pionのような適応的機構が有効である。また、RLVRでは事前学習で獲得したヘッド特化を維持することが重要であり、パーヘッドモードがその解決策となる。業界への含意として、最適化器の改良は計算コストを増やさずに性能を向上させられるため、実用上の価値が高い。未確定の論点としては、Pionの理論的な収束保証や、より大規模なモデルや多様なタスクでの汎用性が挙げられる。また、実ロボットでの評価は3タスクに限られており、より複雑な操作への適用可能性は今後の検証が必要である。
なぜ重要か
この研究は、最適化器の設計が事前学習と事後学習で異なるアプローチを必要とすることを示し、特にロボット操作やRLVRのような領域での性能向上に寄与する。Pionは既存の最適化器と同等の計算効率を保ちながら、シミュレーションと実機で優れた結果を示しており、基盤モデルの実用化に向けた重要な一歩となる。