何が起きたか

研究チームは2026年8月17日にarXivで公開した論文「SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation」において、新しい階層型VLAシステム「SparkVLA」を発表した。同システムは、サブタスクの終了タイミングとアクションチャンクの実行長という2つの決定を単一のランキング問題として扱い、統一候補セット内で「Stop」と各アクションプレフィックス長を競わせ、最高スコアの選択肢を選ぶ。RoboCerebraベンチマークで成功率47.12%を達成し、公式の階層型ベースラインを30.57%、再現可能な最強手法を26.83%上回った。実ロボット実験でもマルチステップタスクで性能向上を確認した。

詳細

既存の階層型VLAアーキテクチャでは、サブタスクの終了決定とアクションチャンクの実行長決定が分離して評価されるが、これらは相互依存関係にある。最適な停止点は実行計画に依存し、最適な実行長はサブタスク境界に依存する。SparkVLAはこの相互依存を解消するため、両決定を単一のランキングとして定式化し、閾値調整を不要にし、オフラインの順序選好のみを必要とする。 さらに、Anchor-Conditioned Context Encodingモジュールが、履歴を考慮したサブタスクアンカーエンコーディング(オンセット状態メモリとゴールセマンティクス)をキャッシュし、視覚トークンのプルーニングをタスク関連領域に誘導する。Stop-Aware Action-Prefix Selectionヘッドは、チャンク境界で全自己注意を用いて全候補をスコアリングし、効率を高める。

Key Facts

SparkVLAは、サブタスク終了とアクションチャンク長の決定を単一のランキングとして扱う階層型VLAシステムである。[1]
RoboCerebraベンチマークで成功率47.12%を達成した。[1]
公式の階層型ベースラインを30.57%上回った。[1]
再現可能な最強手法を26.83%上回った。[1]
実ロボット実験でマルチステップタスクの性能向上を確認した。[1]
Anchor-Conditioned Context Encodingモジュールが、履歴を考慮したサブタスクアンカーエンコーディングをキャッシュする。[1]
Stop-Aware Action-Prefix Selectionヘッドが、チャンク境界で全自己注意を用いて全候補をスコアリングする。[1]

なぜ重要か

本提案は、階層型VLAにおける相互依存する決定問題を統一的に扱う新たな枠組みを示し、長期的な操作タスクの性能向上に寄与する。閾値調整を不要にし、オフラインの順序選好のみで学習できる点は、実用上の利点となる。