何が起きたか

arXivに2025年8月23日付で掲載された論文『NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows』において、研究チームはVision-Language-Action(VLA)モデルのアクションデコーダとして正規化フロー(Normalizing Flow)を用いる手法「NinA」を発表した。NinAは拡散モデルベースのデコーダを置き換え、一回のサンプリングでアクションを生成する。FLOWER VLAアーキテクチャに統合され、LIBEROベンチマークで微調整された。実験では、同じ訓練条件下で拡散モデルと同等の性能を示しつつ、推論速度が大幅に向上したと報告されている。

詳細

近年のVLAモデルは、事前学習済みのVision-Language Model(VLM)が視覚観察とタスク記述をエンコードし、アクションデコーダがそれらを連続アクションにマッピングする2コンポーネント構成が確立している。拡散モデルは複雑で多峰的なアクション分布をモデル化できるため、アクションデコーダとして広く採用されてきたが、推論時に複数の反復的デノイジングステップが必要であり、高周波制御が重要な実世界設定での実用性を制限していた。 NinAは、拡散モデルの代わりに正規化フローを用いることで、可逆変換による一回のサンプリングを可能にし、推論時間を大幅に削減する。研究チームはNinAをFLOWER VLAアーキテクチャに統合し、LIBEROベンチマークで微調整した。実験結果は、NinAが同じ訓練条件下で拡散モデルベースのデコーダと同等の性能を達成しつつ、推論速度が大幅に速いことを示した。これにより、性能を損なうことなく高周波VLA制御への有望な道を提供するとしている。

Key Facts

論文『NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows』がarXivに2025年8月23日付で掲載された。[1]
NinAはVLAモデルのアクションデコーダとして正規化フローを採用する。[1]
NinAは拡散モデルベースのデコーダを置き換え、一回のサンプリングでアクションを生成する。[1]
NinAはFLOWER VLAアーキテクチャに統合され、LIBEROベンチマークで微調整された。[1]
実験では、NinAは同じ訓練条件下で拡散モデルと同等の性能を達成した。[1]
NinAは拡散モデルと比較して推論速度が大幅に向上した。[1]
拡散モデルは複雑で多峰的なアクション分布をモデル化できるが、推論時に複数の反復的デノイジングステップが必要である。[1]

なぜ重要か

この研究は、VLAモデルの実世界応用における推論速度のボトルネックに対処するものである。正規化フローを用いることで、性能を維持しつつ高速なアクション生成が可能となり、高周波制御が求められるロボットタスクへの応用が期待される。