何が起きたか
arXivに公開された論文(識別番号2608.02958v1)において、ValueFormerと呼ばれる因果トランスフォーマー価値関数が提案された。これは、半自律的なVision-Language-Action(VLA)ポリシー向けに設計されており、凍結されたDINOv3バックボーン上で動作する。1回のフォワードパスで、モンテカルロ価値V_mcとバイナリ価値の2つのフレーム単位信号を出力する。失敗エピソードには、ステージ認識型の成功後減衰リターンがラベル付けされ、誤り検出は単一の失敗時刻ではなく誤り区間から教師される。実ロボットによる両腕サンドイッチ組み立てタスク(1,427エピソード)で、批評家由来のフレーム単位訓練重みによりタスク完了率が70%から85%に向上した(n=20でノイズ範囲内)。また、バッチ処理されたbf16エンコーダによりライブ推論コストが3〜5倍削減され、批評家は単一GPU上でポリシーと並行して2Hzで動作する。
Key Facts
| ValueFormerは、半自律的なVision-Language-Action(VLA)ポリシー向けの因果トランスフォーマー価値関数である。 | [0] |
| ValueFormerは凍結されたDINOv3バックボーン上で動作し、1回のフォワードパスでモンテカルロ価値V_mcとバイナリ価値の2つのフレーム単位信号を出力する。 | [0] |
| 失敗エピソードには、ステージ認識型の成功後減衰リターンがラベル付けされ、誤り検出は単一の失敗時刻ではなく誤り区間から教師される。 | [0] |
| 実ロボットによる両腕サンドイッチ組み立てタスク(1,427エピソード)で、批評家由来のフレーム単位訓練重みによりタスク完了率が70%から85%に向上した(n=20でノイズ範囲内)。 | [0] |
| バッチ処理されたbf16エンコーダによりライブ推論コストが3〜5倍削減され、批評家は単一GPU上でポリシーと並行して2Hzで動作する。 | [0] |
なぜ重要か
この研究は、行動クローニングで訓練されたVLAポリシーが、行動ストリームだけではロールアウトの失敗を検出できないという問題に取り組む。フレーム単位のラベル設計が重要であると主張し、密で連続的かつ適切に整形されたラベルを提供することで、オンラインの誤り検出とアドバンテージ推定を可能にする。実ロボットタスクでの完了率向上と推論コスト削減は、ロボット学習の実用性向上に寄与する可能性がある。