何が起きたか
arXiv掲載の論文「Fewer Steps, Better Actions: Rethinking Flow-Matching Inference for VLA Policies」は、2026-09-18に、VLAポリシーのflow matching推論で反復積分の一部を単一の学習済み終端補正に置き換える手法「Coda」を示した。論文では、5ステップ版で50のRoboTwin Easyタスクの成功率が71.64%から74.68%に改善し、既定の10ステップ版比でforward latencyを30.2%削減したとしている。2ステップ版では成功率71.88%と2.12倍の高速化を示し、凍結済みの公式SmolVLAでも2ステップ成功率を60.8%から69.4%に引き上げたとしている。
詳細
Codaでは、凍結したpolicyが少数ステップでnoise-to-action trajectoryを完了し、その後に軽量Transformerがcandidate action、source noise、shared observation-prefix cacheを用いて、デモンストレーション監督の残差を予測する。学習されるのはcorrectorのみである。 論文は、50 RoboTwin Easy tasksに加え、独立した13-task controlでも評価しており、そこで5.69 percentage pointsの改善をほぼ同じ遅延で示したとしている。著者らは、endpoint correctionがflow-matching policiesのquality-latency trade-offを改善する代替手段だと結論づけている。
Key Facts
| Codaは、flow matchingで動作チャンクを生成するVLAポリシー向けに、学習済み終端補正を加える手法である。 | [1] |
| 論文では、50 RoboTwin Easy tasksで5-step Codaの成功率が71.64%から74.68%に改善したとしている。 | [1] |
| 論文では、5-step Codaがdefaultの10-step policy比でforward latencyを30.2%削減したとしている。 | [1] |
| 2-step configurationは成功率71.88%と2.12× speedupを示したとしている。 | [1] |
| 凍結済みの公式SmolVLAでは、2-step successが60.8%から69.4%に上昇したとしている。 | [1] |
本紙の見方
この論文の新規性は、flow matching型VLAの推論で「ステップを増やして精度を稼ぐ」発想を崩し、少数ステップの軌道に終端補正を足すことで品質と遅延の両立を狙っている点にある。重要なのは、推論本体を学習し直すのではなく、policyを凍結したままcorrectorだけを学習していることで、既存モデルの再利用を前提にした設計になっている。5ステップで成功率が71.64%から74.68%に上がり、10ステップ比で遅延を30.2%下げたという結果は、単純な反復増加が最適ではないことを示す材料である。 本紙の見方では、これはVLAの推論設計を「生成の反復回数」から「どこで誤差を補正するか」に移す試みといえる。候補行動、source noise、shared observation-prefix cacheを入力に残差を推定する構造は、実世界行動の判断を末端で締める発想であり、計算を前段に厚く積むよりも、最終出力の微修正に資源を振り向ける。13-task controlで5.69 percentage pointsの改善をほぼ同じ遅延で示した点は、特定環境だけの偶然ではなく、補正の設計自体に一定の一般性がある可能性を示す。ただし、論文中の評価はRoboTwin Easyと13-task controlに限られ、実機での挙動や別ドメインへの転用可能性はまだ読み切れない。 既存のflow-matching系VLAでは、ステップ数を増やせば推論コストが増す一方で、closed-loop successが必ずしも伸びないという問題設定がある。Codaはこのギャップに対し、追加ステップの代わりに補正器を置くことで応答する。SmolVLAでも2-step successが60.8%から69.4%へ上がった事実は、手法が単一モデル専用の小技ではなく、凍結済みの公式モデルにも差し込める可能性を示す。もっとも、どの程度の計算増でどこまで改善するか、補正器のサイズ、学習データの性質、タスク難度ごとの効き方は本文だけでは十分に分からない。次に確認すべき論点は、より長いホライゾンのタスクでの安定性、実機ロボットでの再現性、そして補正器が失敗例をどの程度抑えるかである。
なぜ重要か
flow-matching型VLAでは、推論ステップを増やすだけでは遅延と成功率の両立が難しいことが示されており、Codaはその代替として終端補正を提示した点に意味がある。50 RoboTwin Easy tasksでの成功率改善と30.2%の遅延削減、SmolVLAでの60.8%→69.4%という改善は、既存の凍結モデルに手を入れず性能改善を狙う選択肢として検討対象になりうる。