何が起きたか

研究チームは2026年8月10日、arxiv.orgにて、視覚・言語・行動(VLA)モデルSmolVLAの行動エキスパートにMamba型選択的状態空間モデルを導入した論文を発表した。LIBEROベンチマークで評価した結果、再計画までの実行アクション数N=50(実時間展開が可能な設定)ではTransformerベースラインを7.8%上回る成功率を達成。N=25では3.7%上回り、N=1では成功率を維持しつつパラメータ数を24%削減した。

詳細

本研究は、VLAモデルの精度と計算複雑性のトレードオフ改善を目的とし、SmolVLAの行動エキスパート内の因果的自己注意をMambaの選択的状態空間モデルに置き換えた。評価はLIBEROベンチマークの3つの実行ホライゾンN∈{1,25,50}で実施。N=50(実時間展開に相当)でTransformer比7.8%の成功率向上、N=25で3.7%向上、N=1では成功率を一致させつつパラメータ数を24%削減した。

Key Facts

Mamba型エキスパートはN=50でTransformerベースラインを7.8%上回る成功率を達成した。[1]
N=25では3.7%の成功率向上、N=1では成功率を維持しつつパラメータ数を24%削減した。[1]
評価はLIBEROベンチマークの3つの実行ホライゾンN∈{1,25,50}で実施された。[1]
Mambaの選択的状態空間モデルをSmolVLAの行動エキスパートに適用した。[1]

本紙の見方

本研究成果の核心は、VLAモデルの実時間展開における根本的なトレードオフを、行動エキスパートのアーキテクチャ変更のみで改善した点にある。従来、VLAモデルでは推論ごとに1アクションを実行する方式(N=1)が高精度だが計算負荷が高く、実時間制約を満たせない。一方、長いアクションホライゾン(N≫1)は計算効率を高めるが成功率が低下する。本研究は、このトレードオフをMambaの選択的状態空間モデルによって緩和し、特に実時間展開が可能なN=50でTransformer比7.8%の成功率向上を実現した。これは、ロボット制御の実用化に向けた重要な前進である。 本論文は、計算効率の高いMambaが、長いシーケンス処理において自己注意機構よりも優れた性能を発揮することを示す。特に、N=50のような長い実行ホライゾンでは、Mambaの選択的状態空間モデルが過去の情報を効率的に保持し、再計画の頻度を減らしても精度を維持できることを示唆している。また、N=1でのパラメータ数削減は、モデルの軽量化に寄与し、エッジデバイスへの展開可能性を広げる。 業界構造への含意として、VLAモデルの実時間展開が可能になれば、ロボットの自律性が向上し、動的環境でのタスク実行が現実的になる。特に、LIBEROベンチマークは操作タスクの標準的な評価指標であり、この結果は他のVLAモデルにも応用可能な知見を提供する。今後は、実ロボットでの検証や、より複雑なタスクでの評価が焦点となる。 未確定の論点として、本研究はシミュレーション環境(LIBERO)での評価であり、実世界での性能は未検証である。また、Mambaエキスパートの計算時間やメモリ使用量の詳細な比較、他のVLAモデルへの適用可能性も今後の課題である。

なぜ重要か

VLAモデルの実時間展開はロボット制御の実用化に不可欠であり、本研究はその障壁を低減する具体的な手法を示した。Mambaの導入により、計算効率と精度の両立が可能になることで、ロボットの自律性向上やエッジ展開が進むと期待される。