日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.02958v1

ValueFormer: ステージ認識ラベルを備えた半自律VLAポリシーのための因果トランスフォーマー価値関数

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

シェア:XThreadsFacebookLINEはてブBluesky

行動クローニングによるVLAポリシーは失敗を検出できないため、密で連続的な価値ラベルを生成するコンパクトな因果トランスフォーマーを提案し、実ロボットのサンドイッチ組み立てタスクで成功率を70%から85%に向上させた。

詳しい要約

1. どんなもの?

ValueFormerは、半自律型Vision-Language-Action (VLA)ポリシーのための、ポリシーに依存しないコンパクトなcausal transformerである。凍結されたDINOv3バックボーン上で動作し、1回のフォワードパスで2つのフレーム単位信号を出力する。1つはadvantage estimationのための滑らかなMonte Carlo value (V_mc)、もう1つはオンラインのmistake detectionのためのsharpなbinary valueである。これらのターゲットは意図的に反対方向に引っ張るように設計されている。失敗エピソードには、失敗段階の前に成功曲線を保持するstage-awareなsuccess-then-decay returnがラベル付けされ、検出は単一の失敗時刻ではなくmistake intervalsから教師されるため、ポリシーが回復するミスにも信号が含まれる。

2. 先行研究と比べてどこがすごい?

従来のbehavior cloningで訓練されたVLAポリシーは、行動ストリームだけからは崩壊と成功の進行を区別できず、暗黙の進捗概念が欠如している。強化学習は進捗を提供するが、実ロボット経験のコストや変形可能な食品のシミュレーション困難さから非現実的である。終端の成功/失敗ビットは原理的には学習可能だが、ロールアウトがいつ失敗したかを示すには疎すぎる。ValueFormerは、密で連続的かつ適切に整形されたフレーム単位ラベルを提供することで、アーキテクチャではなくラベルが難しい部分であるという主張に基づき、この問題に取り組む。

3. 技術・手法の肝は?

手法の肝は、フレーム単位ラベルの設計にある。失敗エピソードには、失敗段階の前に成功曲線を保持するstage-awareなsuccess-then-decay returnを使用する。これにより、V_mcは滑らかなMonte Carlo valueとしてadvantage estimationに適し、binary valueはmistake detection用にsharpになる。検出は単一の失敗時刻ではなくmistake intervalsから教師されるため、ポリシーが回復するミスにも信号が含まれる。アーキテクチャは、凍結されたDINOv3バックボーン上のコンパクトなcausal transformerであり、ポリシーに依存しない。

4. どうやって有効だと検証した?

実ロボットの両腕サンドイッチ組み立てタスク(1,427エピソード)で検証した。critic由来のフレーム単位訓練重みにより、タスク完了率が70%から85%に向上した(n=20でノイズ範囲内)。また、バッチ処理されたbf16エンコーダにより、ライブ推論コストを3〜5倍削減し、criticは単一GPU上でポリシーと並行して2 Hzで動作する。

5. 議論はある?

要旨からは、タスク完了率の向上がn=20でノイズ範囲内であると報告されており、統計的有意性が明確でない可能性が示唆される。また、提案するラベル設計の一般性や、他のタスクやポリシーへの適用可能性については要旨からは不明である。さらに、V_mcとbinary valueが意図的に反対方向に引っ張る設計の理論的根拠や、その相互作用の詳細は要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Vision-Language-Action (VLA) policies、behavior cloning、reinforcement learning、DINOv3 backbone、Monte Carlo value estimation、advantage estimation、mistake detectionなどが挙げられる。具体的な論文名は要旨にないため、同分野の定番として、VLAポリシーの基盤となるRT-2やPaLM-E、behavior cloningの標準的手法、DINOv3の元論文などを読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Inkyu Sa, Konstantin Stulov, Rajat Bhageria

分類: cs.RO, cs.AI

原文アブストラクト

Vision-Language-Action (VLA) policies trained by behavior cloning fail silently: from the action stream alone, a collapsing rollout looks much like one making clean progress, because imitation supplies no notion of progress. Reinforcement learning would supply one, but it is impractical here, where real-robot experience is costly and deformable food resists simulation. The cheap alternative, a terminal success / failure bit, is learnable in principle yet far too sparse to say when a rollout went wrong. We argue that the per-frame label, not the architecture, is the hard part: to be useful it must be dense, continuous, and correctly shaped. We present ValueFormer, a compact policy-agnostic causal transformer over a frozen DINOv3 backbone that emits two per-frame signals in one forward pass: a smooth Monte Carlo value, V_mc, for advantage estimation and a sharp binary value for online mistake detection, targets that pull in opposite directions by design. Failed episodes are labeled with a stage-aware, success-then-decay return that preserves the success curve before the failure stage, and detection is supervised from mistake intervals rather than a single failure time, so mistakes the policy recovers from also carry signal. On a real-robot bimanual sandwich-assembly task 1,427 episodes), a critic-derived per-frame training weight lifts task completion from 70% to 85% (within noise at n=20), and a batched bf16 encoder cuts the live serving cost 3~5 times so the critic runs at 2 Hz alongside the policy on a single GPU.