何が起きたか
arxiv.orgは2026-09-28、長時間の動的操作向けに「D^2-VLA: Dual-Memory Dual-Frequency Vision-Language-Action Model For Long Dynamic Manipulation」を公開した。D^2-VLAは、事前学習済みVLAのKV-cache層で双記憶・双周波制御を組み合わせ、視界外になった手がかりを保持しながら移動物体に対応する設計である。DOMINO-Longでは60.0%、DOMINOでは29.3%の完全タスク成功率を示し、既存比較対象のπ_{0.5}やPUMAを上回った。
詳細
手法面では、観測をブロック単位の因果KVキャッシュで段階的に符号化し、VLM向けと行動エキスパート向けに別の履歴KV参照を構成する。定期的なVLM更新の間は、ゲート付きアダプタが最新の履歴条件付きKVブロックに新しい視覚特徴を取り込み、短いfast-memory queueが再計画を支える。 評価では、著者らはDOMINO-Longという10タスクのベンチマークを導入した。同モデルはDOMINOで29.3%を記録し、π_{0.5}の9.6%、PUMAの17.2%を上回った。DOMINO-Longでは60.0%で、π_{0.5}の35.4%、PUMAの20.6%を上回ったほか、8つの実機ロボットタスクで成功率を改善し、LIBERO-Longで97.5%、RoboTwin 2.0で74.3%に達した。
Key Facts
| arxiv.orgは2026-09-28に「D^2-VLA: Dual-Memory Dual-Frequency Vision-Language-Action Model For Long Dynamic Manipulation」を公開した。 | [1] |
| D^2-VLAは、事前学習済みVLAのKV-cacheインターフェースで双記憶と双周波制御を組み合わせる。 | [1] |
| DOMINO-Longは10タスクのベンチマークである。 | [1] |
| D^2-VLAはDOMINOで29.3%、DOMINO-Longで60.0%の完全タスク成功率を示した。 | [1] |
| 比較対象として、DOMINOではπ_{0.5}が9.6%、PUMAが17.2%、DOMINO-Longではπ_{0.5}が35.4%、PUMAが20.6%だった。 | [1] |
本紙の見方
D^2-VLAの新しさは、ロボット政策の主流であるVLAを置き換えることではなく、KV-cacheの使い方を変えて長時間の操作に耐える記憶構造を加えた点にある。最新観測だけに依存しがちな既存VLAに対し、履歴KVをVLM用と行動用で分け、更新頻度もずらしたことが核心であるため、これは大規模モデルの新規アーキテクチャというより、推論時の状態保持を厚くした制御層の改良とみるのが適切である。 本紙の見方では、注目点は性能の絶対値よりも、長時間・動的環境で「見えていないものを覚えておく」処理を、VLM再実行だけに頼らずに回している点にある。DOMINO-Longを新設したのも、その課題を通常の短時間タスクでは測れないと判断したためと読める。比較でπ_{0.5}とPUMAを置いていることからも、論文は単なるベンチマーク更新ではなく、記憶更新頻度と行動再計画の分離が有効かを検証する構図を取っている。 ロボットのVLAは、モデルサイズ競争だけでなく、実世界での記憶管理・再計画・観測更新の設計が差になる段階に入っているとみられる。特に、実機で8タスク改善、LIBERO-Longで97.5%、RoboTwin 2.0で74.3%という結果は、長時間操作の評価系が今後の標準になる可能性を示す一方、対象タスクの範囲、実機条件、計算コスト、KV-cache増大時の安定性はまだ確認が必要である。
なぜ重要か
長時間の動的操作では、ロボットが直前の画像だけでなく過去の手がかりを保持できるかが課題になる。D^2-VLAは、arxiv.orgが2026-09-28に公開した論文で、VLMの再計算回数を抑えつつ履歴を使う設計を示しており、実機8タスクと複数ベンチマークでの成功率を根拠に、その課題への一つの解を提示している。
日本への影響
日本のロボット研究・実装では、単体の認識精度だけでなく、KV-cacheを使った履歴保持や再計画を含む制御設計が重要になる可能性がある。特に、長時間操作や移動物体を扱うアプリケーションでは、VLMの再実行コストと記憶管理が実装上の論点になる。