何が起きたか
arXivは2026年9月19日、視覚言語行動モデル「SmoLSTM: A Compact Vision-Language-Action Model with Recurrent Memory that Persists」を公開した。論文は、エピソード全体を通じてリセットしない再帰状態を用い、行動予測に履歴を持ち込む設計を示している。公開文面では、7,461件のデモンストレーション、140タスク、0.04Bの学習可能パラメータで評価し、LIBERO-Memで85.1%のサブゴール被覆率と77.5%のフルタスク成功率を得たとしている。
詳細
論文は、凍結した256MパラメータのSmolVLMバックボーンに、マトリクスメモリLSTMの制御層を組み合わせている。観測トークンと行動クエリを単一の因果ストリームに統合し、そのストリームをエピソード全体でリセットしないため、再帰状態の格納コストはエピソード長に対してO(1)だとしている。 出力ヘッドは、各制御ステップで10個のエンドエフェクタ姿勢差分とグリッパーコマンドのチャンクを予測する。評価では、再帰状態を毎ステップで初期化するとフルタスク成功率が7.0%に落ち、標準LIBEROでは平均79.6%の成功率を示したとしている。
Key Facts
| arXivは2026年9月19日、SmoLSTM論文を公開した。 | [1] |
| SmoLSTMは凍結した256MパラメータのSmolVLMバックボーンと、マトリクスメモリLSTMの制御層を組み合わせる。 | [1] |
| 観測トークンと行動クエリを単一の因果ストリームに統合し、再帰状態をエピソード全体でリセットしない設計である。 | [1] |
| 学習は7,461件のデモンストレーションと140タスクで行われ、学習可能パラメータは0.04Bである。 | [1] |
| LIBERO-Memで85.1%のサブゴール被覆率、77.5%のフルタスク成功率、標準LIBEROで79.6%の平均成功率を示した。 | [1] |
本紙の見方
SmoLSTMの新しさは、視覚言語行動モデルを単なる「現在の観測への反応」から、エピソード全体を保持する再帰状態へ移した点にある。ここで重要なのは、追加の大きな観測窓を足して履歴を広げるのではなく、観測トークンと行動クエリを一つの因果ストリームにまとめ、状態を最後まで持続させていることである。これはモデルの記憶を入力長の拡張ではなく制御層の設計で担保する構成であり、O(1)という記述からも、長いエピソードでの状態保持を前提にした実装思想が読み取れる。 本紙の過去報道はないため、連続性の整理はできない。ただ、公開文面だけを見ると、LIBERO-Memでの85.1%と77.5%は、標準LIBEROの79.6%と並べて読む必要がある。メモリを要する環境で強い一方、通常設定でも一定の性能を保つことが示されており、記憶機構が特殊タスク専用の付加物ではない可能性がある。逆に、再帰状態を毎ステップで初期化すると7.0%まで落ちるため、性能の源泉が単純な視覚認識ではなく、前段の文脈保持に強く依存している点が際立つ。 業界構造への含意としては、焦点はモデル規模の大型化よりも、記憶の持たせ方と行動出力の切り方にある。256Mの凍結バックボーンと0.04Bの学習可能パラメータで成績を出している以上、計算資源の増量よりも、どの情報を状態に残し、どのタイミングで10個の姿勢差分とグリッパー指令へ落とすかが競争軸になりうる。反面、評価はLIBERO系に限られているため、実機での長時間タスク、遮蔽条件、視覚的に同一な対象が多い環境で同じ依存関係が成り立つかはなお確認が必要だとみられる。今後は、記憶の保持長、失敗時の状態汚染、学習データの構成、そして制御ステップごとの出力分解が他環境に移植できるかが焦点になる。
なぜ重要か
論文は、遮蔽や見た目が似た対象を含むタスクでは、現在の観測だけでは曖昧になりうると指摘し、エピソード履歴を保持する設計を示した。これは、ロボット制御で「何を見たか」だけでなく「何が起きたか」を状態として持つ必要がある場面に関係する。
日本への影響
日本向けには、視覚認識の精度だけでなく、現場の履歴を保持する制御設計が必要なロボット用途がある場合に示唆がある。ただし、この論文はLIBERO系評価に限られており、日本の産業現場への適用可否は本文からは判断できない。