何が起きたか

arXivに2026年8月17日付で公開された論文「Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory」において、BATONという手法が提案された。BATONは、長期的なロボット操作を複数のサブタスクに分割し、各サブタスクを短期的な探索で解決してメモリに保存する。これにより、探索コストが段階数に比例するT*Kとなり、失敗がどの段階で起きたかを特定できる。また、遷移認識メモリを導入し、サブタスク間の引き継ぎを改善する。RoboMemArenaベンチマークでは、タスク成功率を11.6%、累積成功率を14.9%向上させた。

詳細

長期的なロボット操作は、接触を伴う複数のスキルを連結した多段階タスクである。視覚言語行動(VLA)モデルは個々のスキルを習得できるが、チェーン全体ではエラーが蓄積し、サブタスクが次のサブタスクを制約する問題がある。既存の手法では、VLAを固定し、LLMエージェントが言語で計画し、解析的なプリミティブで自由空間を移動し、接触を伴う部分のみVLAを呼び出す。しかし、この手法は2つの問題を抱える。第一に、テスト時のタスク全体の探索コストが段階数に対して指数関数的(T^K)になる。第二に、遷移の表現がなく、VLAプリミティブは出口条件を持つが入口条件を持たないため、サブタスクが後続のサブタスクが利用できない形式で成功することがある。 BATONは、これらの問題に対処する。探索の単位をサブタスクとし、各サブタスクを短期的な探索で解決し、その解をメモリに保存する。長期的な軌道はこれらの解を合成して構成されるため、探索コストは加算的(T*K)になり、失敗は単一の段階に帰属できる。また、遷移認識メモリを導入し、サブタスク内では検証エージェントが呼び出し遷移を管理し、手首カメラがシーンを確認した後にのみVLAを呼び出す。サブタスク間では、ハンドオフ遷移が前のサブタスクの残渣で乱れたエントリ状態を復元し、ルックアヘッド遷移が後続のサブタスクが継承できる結果を持つ戦略を選択する。パラメータ更新は行われない。

Key Facts

BATONは、長期的ロボット操作のための手法で、エージェント的サブタスク探索と遷移認識メモリを特徴とする。[1]
BATONはRoboMemArenaベンチマークでタスク成功率を11.6%向上させた。[1]
BATONはRoboMemArenaベンチマークで累積成功率を14.9%向上させた。[1]
BATONはパラメータ更新を行わない。[1]
BATONは探索コストを加算的(T*K)にする。[1]
BATONは失敗を単一の段階に帰属させる。[1]
BATONは遷移認識メモリを導入し、検証エージェントが手首カメラでシーンを確認した後にのみVLAを呼び出す。[1]
BATONはハンドオフ遷移とルックアヘッド遷移を備える。[1]

なぜ重要か

BATONは、長期的なロボット操作におけるエラー蓄積と探索コストの問題を解決する新しい枠組みを提供する。パラメータ更新を伴わずに既存のVLAモデルを活用できるため、実用的な応用が期待される。RoboMemArenaでの性能向上は、このアプローチの有効性を示している。