何が起きたか
研究チームは2026年5月19日にarXivで論文を公開し、最適化器Muonが事前学習後のVLA訓練とRLVRで根本的な限界を持つことを明らかにした。その解決策として、高域通過NS反復を特徴とするPionを提案し、シミュレーションと実ロボットで性能を実証した。
詳細
Muonは、Newton-Schulz反復を用いて運動量行列の特異値を1に近づけることでスペクトル勾配の直交化を実現する行列認識型最適化器である。しかし、低ランクなアクションモジュール勾配や低SNR勾配が存在するVLA訓練やRLVRでは、一様なスペクトル白色化が不安定になる。Pionは、この一様な白色化を、支配的な特異値を1に固定しノイズ成分を0に抑える2段階の促進・抑制機構に置き換える。さらに、注意ヘッドごとに独立して更新を適用するパーヘッドモードを追加コストなしでサポートする。実験では、LIBEROおよびLIBERO-PlusでのVLA訓練において、PionはVLA-AdapterとVLANeXtの両方でベースラインを上回り、VLA-AdapterでLIBERO Objectの成功率100%を達成した(Muonは97.0%、AdamWは32.2%)。また、pi_0.5バックボーンを用いたFranka Research 3ロボットによるDROIDセットアップの3つの把持配置タスクでも優位性を示した。RLVRでは、Qwen3-1.7B/4BでGRPOとGMPOを用いた事後訓練において、PionはMATHとGSM8KでAdamWを上回り、Muonはゼロに崩壊した。
Key Facts
| MuonはNewton-Schulz反復を用いて運動量行列の特異値を1に近づける行列認識型最適化器である。 | [1] |
| Pionは高域通過NS反復を導入し、支配的な特異値を1に固定しノイズ成分を0に抑える。 | [1] |
| LIBERO ObjectでPionはVLA-Adapterで100%の成功率を達成し、Muonは97.0%、AdamWは32.2%だった。 | [1] |
| PionはFranka Research 3ロボットとpi_0.5バックボーンを用いたDROIDセットアップの3つの把持配置タスクで優位性を示した。 | [1] |
| RLVRでPionはQwen3-1.7B/4BでMATHとGSM8KでAdamWを上回り、Muonはゼロに崩壊した。 | [1] |
なぜ重要か
この研究は、最適化器の設計が事前学習と事後学習で異なるアプローチを必要とすることを示し、特にロボット操作やRLVRのような領域での性能向上に寄与する。Pionは既存の最適化器と同等の計算効率を保ちながら、シミュレーションと実機で優れた結果を示しており、基盤モデルの実用化に向けた重要な一歩となる。