何が起きたか

arXiv.orgは2026-10-02、論文「FastOPD: On-Policy Distillation for Lightweight VLA Deployment」を公開した。論文は、Vision-Language-Action(VLA)基盤モデルの計算負荷を抑え、軽量な学生モデルとして実機展開しやすくするためのオンポリシー蒸留枠組みを提案している。LIBEROでは2回の推論ステップでπ0.5の性能の84%を保ち、推論遅延を78.1%下げたとしている。

詳細

著者らは、教師モデルの単一状態監督に合わせたflow mapを適用し、自己整合性の目的関数を組み合わせることで、教師の動きを学ぶコンパクトな学生モデルを構成したとしている。理論面では、同目的関数の最小化により、理想的な少ステップ教師モデルが誘導する分布に匹敵する分布を回復できると示したとしている。 評価は、シミュレーションと実世界実験で行ったとしている。LIBEROでは2回の推論ステップでπ0.5の性能の84%を維持し、平均成功率で既存の少ステップ蒸留ベースラインを上回ったとしている。LingBot-VLAを教師にしたRoboTwin 2.0では、ベース学生に比べ単一ステップ成功率が15.9ポイント改善したとしている。さらに、World Action Model(WAM)への適用可能性も示し、MolmoAct2から蒸留したコンパクトな学生を実機ロボットに展開したとしている。

Key Facts

arXiv.orgは2026-10-02に「FastOPD: On-Policy Distillation for Lightweight VLA Deployment」を公開した。[1]
論文は、VLA基盤モデルを軽量に展開するためのオンポリシー蒸留枠組み「FastOPD」を提案した。[1]
LIBEROでは、FastOPDが2回の推論ステップでπ0.5の性能の84%を維持したとしている。[1]
同論文は、LIBEROで推論遅延を78.1%削減したとしている。[1]
LingBot-VLAを教師にしたRoboTwin 2.0では、単一ステップ成功率がベース学生比15.9ポイント改善したとしている。[1]

本紙の見方

FastOPDの新規性は、VLAの軽量化を単に層を小さくしたり反復ステップを削ったりする発想ではなく、オンポリシー蒸留として再定義した点にある。論文は、教師の単一状態監督に合わせたflow mapと自己整合性目的関数を組み合わせ、少ない推論ステップでも教師に近い分布を学生に学ばせる設計を示した。ここで重要なのは、計算量の削減と行動分布の保持を同時に狙っていることであり、推論短縮がそのまま性能劣化になるという従来の単純なトレードオフを緩める狙いが読み取れる。 数値面では、LIBEROで2ステップ・性能84%・遅延78.1%減という組み合わせが核である。単なる「高速化」ではなく、少ステップ化の代償をどこまで抑えられるかが評価軸になっている。さらに、LingBot-VLAを教師にしたRoboTwin 2.0で単一ステップ成功率が15.9ポイント改善した点は、手法が一つの教師モデルや一つのベンチマークに閉じないことを示す。ただし、実機展開の記述はMolmoAct2から蒸留したコンパクト学生を実ロボットに載せた事実までで、どの機体構成や制御周期、失敗率がどの程度だったかは本文からは読めない。 本紙の見方では、これはVLAの性能競争そのものより、展開可能な計算予算へ落とし込むための中間層技術の提案である。VLA基盤モデルが高性能化するほど、そのままでは実機への遅延・計算コストが障害になるため、教師モデルの知識を少ステップの学生へ写す工程が重要になる。今回の論文は、その写像を理論と実験の両面で正当化しようとしているが、未確定なのは実ロボットでの汎用性の範囲、教師選択に対する感度、そして学習データやタスクが変わったときに84%や78.1%の水準がどこまで維持されるかである。

なぜ重要か

論文が示したのは、VLAを実機で使う際の障害が性能不足だけでなく推論コストにあるという点だ。LIBEROで2ステップ・78.1%の遅延削減を示したことは、限られた計算資源での導入を考える研究者や実装側にとって、少ステップ化の具体的な比較材料になる。 また、RoboTwin 2.0での15.9ポイント改善と実機ロボットへの展開は、シミュレーション上の圧縮だけで終わらず、実運用に近い場面での評価が必要だと示している。