何が起きたか
2025年10月6日にarXivに公開された論文「HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks」で、研究チームはVLAモデルの推論コストを削減する新しいアーキテクチャHyperVLAを提案した。HyperVLAは、既存のモノリシックなVLAモデルとは異なり、推論時には小さなタスク特化ポリシーのみを活性化し、訓練時には多様なマルチタスク行動に対応する高いモデル容量を維持する。OpenVLAと比較して、テスト時の活性化パラメータを90倍削減し、推論速度を120倍高速化する。コードはhttps://github.com/MasterXiong/HyperVLAで公開されている。
詳細
VLAモデルは、汎化能力の高い言語・視覚基盤モデルと大規模なロボットデータで訓練され、汎用ロボットポリシーの学習に有望なアプローチとして登場したが、既存のVLAは推論コストが非常に高いという欠点がある。HyperVLAは、ハイパーネットワーク(HN)ベースのアーキテクチャを採用し、推論時に小さなタスク特化ポリシーのみを活性化することで、この問題に対処する。HNベースのVLAの訓練は容易ではないため、HyperVLAには、既存の視覚基盤モデルの事前知識の活用、HN正規化、行動生成戦略など、性能を向上させるいくつかの重要なアルゴリズム設計が含まれている。
Key Facts
| HyperVLAは、ハイパーネットワーク(HN)ベースのアーキテクチャを採用し、推論時に小さなタスク特化ポリシーのみを活性化する。 | [1] |
| HyperVLAは、既存のモノリシックなVLAモデルと比較して、ゼロショット汎化と少数ショット適応の両方で同等以上の成功率を達成しつつ、推論コストを大幅に削減する。 | [1] |
| OpenVLAと比較して、HyperVLAはテスト時の活性化パラメータを90倍削減し、推論速度を120倍高速化する。 | [1] |
| HyperVLAのコードはhttps://github.com/MasterXiong/HyperVLAで公開されている。 | [1] |
| HyperVLAは、既存の視覚基盤モデルの事前知識の活用、HN正規化、行動生成戦略などのアルゴリズム設計を含む。 | [1] |
なぜ重要か
VLAモデルはロボットポリシーの学習に有望だが、推論コストが高いことが実用化の障壁となっていた。HyperVLAは、推論時の活性化パラメータを大幅に削減することで、VLAモデルの効率的な推論を可能にし、ロボットへの実装コストを低減する可能性がある。