何が起きたか

2026年4月20日にarXivで公開された論文で、HELM(Harness-Enhanced Long-horizon Memory)というフレームワークが発表された。HELMはVLAモデルの長期操作タスクにおける失敗を、メモリギャップ、検証ギャップ、回復ギャップの3つの欠陥に起因すると分析し、これらを解決する3つのコンポーネントを導入する。LIBERO-LONGベンチマークで、HELMはOpenVLAの成功率を58.4%から81.5%に向上させた。

詳細

HELMは3つのコンポーネントで構成される。Episodic Memory Module (EMM)はCLIPインデックス付きキーフレームを介してタスク履歴を取得する。State Verifier (SV)は実行前にアクション失敗を予測する学習モジュールで、観察、アクション、サブゴール、メモリ条件付きコンテキストから予測する。Harness Controller (HC)はロールバックと再計画を実行する。SVはルールベースの実現可能性チェックやアンサンブル不確実性ベースラインを一貫して上回り、エピソディックメモリへのアクセスに依存する。コンテキストウィンドウをH=32に拡張しても5.4ポイントの向上にとどまり、同予算のLoRA適応はHELMより12.2ポイント低い。HELMはCALVINでも長期性能を向上させ、制御された摂動下での回復成功率を大幅に高めた。また、LIBERO-Recoveryという摂動注入プロトコルをリリースしている。

Key Facts

HELMはVLAモデルの長期操作タスクの失敗を、メモリギャップ、検証ギャップ、回復ギャップの3つの欠陥に起因すると分析している。[1]
HELMはEpisodic Memory Module (EMM)、State Verifier (SV)、Harness Controller (HC)の3つのコンポーネントで構成される。[1]
LIBERO-LONGで、HELMはOpenVLAの成功率を58.4%から81.5%に向上させた(23.1ポイント増)。[1]
コンテキストウィンドウをH=32に拡張しても成功率は5.4ポイントの向上にとどまり、同予算のLoRA適応はHELMより12.2ポイント低い。[1]
HELMはCALVINでも長期性能を向上させ、制御された摂動下での回復成功率を大幅に高めた。[1]

なぜ重要か

この研究は、VLAモデルの長期操作タスクにおける失敗の原因を構造的に分析し、実行時の検証と回復を組み込むことで成功率を大幅に向上させた点で重要である。ロボット操作の実用化には、単にモデルの性能を上げるだけでなく、失敗から回復する能力が不可欠であり、HELMはその方向性を示すものと言える。