何が起きたか

mu-VLAは、記憶なし制御のチェックポイント「mu-vla-openvla-oft-mikasa-robo-5-tasks-no-memory」をHugging Faceで公開した。このモデルは、OpenVLA-OFTレシピでファインチューニングされた7BパラメータのVLAモデルであり、メモリトークンやリカレント状態を持たない。MIKASA-Roboの5つの環境で、エピソード型データローダーを用いて15万ステップ訓練された。このチェックポイントは、mu-VLAの実験マトリックスの実験2に相当し、記憶モジュールの効果を評価するための対照として提供される。

Key Facts

mu-VLAは、記憶なし制御のチェックポイント「mu-vla-openvla-oft-mikasa-robo-5-tasks-no-memory」を公開した。[0]
このモデルはOpenVLA-OFTレシピでファインチューニングされたopenvla/openvla-7bをベースとし、メモリトークンやリカレント状態を持たない。[0]
MIKASA-Roboの5つの環境で、エピソード型データローダーを用いて15万ステップ訓練された。[0]
このチェックポイントはmu-VLAの実験マトリックスの実験2に相当する。[0]
記憶ありのチェックポイントとして、64メモリトークンとTBPTT K=2またはK=8のもの、およびLIBERO用のものがある。[0]
学習率スケジュールは、記憶ありのチェックポイントがコサインスケジュール(2000ウォームアップ、最小比率0.1)を使用するのに対し、このモデルは元のOpenVLA-OFTレシピの定数→減衰スケジュールを使用する。[0]
評価プロトコルは、各環境で独立に100エピソード、シード4242424242、メトリックsuccess_onceで行われる。[0]

なぜ重要か

このチェックポイントは、mu-VLAの記憶モジュールの効果を検証するための対照実験として提供される。記憶なしのベースラインを公開することで、性能向上が記憶機構によるものであることを示すための基準となる。