何が起きたか

arxiv.orgに2026-09-16掲載の論文は、ForceDelta-VLAという補正蒸留フレームワークを発表した。接触豊富な操作において、参照動作と接触に応じた補正を一体で予測する従来のVLA方策を分解し、参照動作と補正を別の標的として学習する。9つの単腕・両腕課題で平均成功率は82.2%となり、元のForceVLAベースラインの54.4%を上回った。

詳細

ForceDelta-VLAは、凍結した教師モデルの「力条件付きモード」と「力非依存モード」の予測をペアで使い、明示的な力補正ターゲットを構成する。さらに、参照動作のずれと参照状態の変化を扱うためのdelay-correction targetを導入した。 学習では、非同期スケジュールリプレイを用い、実行時に利用可能なキャッシュ済みタスク文脈を参照する。実行時には、最近の力履歴とロボット状態を使って参照動作を調整し、参照動作チャンクを完全に再生成せずに接触変化へ対応する。

Key Facts

ForceDelta-VLAは、力条件付き補正を蒸留する補正蒸留フレームワークである。[1]
教師モデルの力条件付きモードと力非依存モードの予測を組み合わせて、力補正ターゲットを構成する。[1]
delay-correction targetで参照動作のずれと参照状態の変化を扱う。[1]
学習には非同期スケジュールリプレイと、実行時に利用可能なキャッシュ済みタスク文脈を使う。[1]
9つの単腕・両腕接触豊富タスクで平均成功率82.2%を達成し、ForceVLAの54.4%を上回った。[1]

本紙の見方

ForceDelta-VLAの新しさは、接触を伴う操作を「参照動作」と「力に応じた補正」に分けて学習可能にした点にある。単に力情報を入力に足した方策ではなく、教師の二つのモードの予測差から補正ターゲットを作るため、補正を再利用しやすい表現に落としている。加えて、delay-correction targetを別に置いているため、参照動作の遅れや参照状態の更新ずれを、接触変化の補正と切り分けて扱う設計だと読める。 本紙の観点では、これはVLAをそのまま大きくする話ではなく、接触操作で破綻しやすい更新単位を細かく再設計した事例である。参照動作を完全再生成せず、最近の力履歴とロボット状態で上書きする構造は、実時間性と接触適応の両立を狙うものとみられる。9課題で82.2%という結果は、ForceVLAの54.4%と比べて改善幅が大きいが、同時に評価対象が単腕と両腕の接触豊富課題に限られている点が重要である。したがって、一般の操作全般よりも、接触の反力が行動更新の主因になる場面で効く手法かどうかが焦点になる。 今後確認すべき論点は、どの程度の計算負荷で動くか、参照動作チャンクの長さ、教師の力条件付き・非依存モードの切り分けが別タスクでも保たれるか、そして接触豊富でない課題に同じ設計が必要かどうかである。

なぜ重要か

論文は、9つの単腕・両腕課題でForceVLAの54.4%に対し82.2%の平均成功率を示している。接触変化のたびに全動作を作り直さず、最近の力履歴とロボット状態で補正する設計は、接触を伴う実機操作での更新単位の作り方を検討する材料になる。

日本への影響

接触を伴う組立、挿入、把持のような課題では、力履歴とロボット状態で補正する設計が論点になるとみられる。日本でこれらの工程に関わるロボット制御や実機評価を進める場合、参照動作をどう切り分けるかが検討対象になりうる。