何が起きたか

arxiv.orgは2026-09-19、Octo-Baseを8層に蒸留した圧縮操作方策について、閉ループで崩壊する因果的事例分析を公表した。学生モデルはパラメータの86%を保持し、ファミリー固有の検証指標では0.996と1.000のteacher-ratioで全てのオフラインチェックを通過した一方、シミュレーションのWidowXピック&プレース課題では0/72に終わり、教師モデルは40/72だった。

詳細

崩壊は一様ではなく、初期段階では緩やかに悪化した。具体的には、物体移動は教師の90%の速度、把持は55%の水準だったが、目標への搬送は訓練の全変種で0%に落ちた。 著者らは、遅い時点に偏った負のz残差を症状として特定し、その大きさは修復後の約10倍で、基礎蒸留と2つの継続分岐の両方で持続した。4つの標準的介入、すなわち継続学習、ドメイン内オフラインデータ、コマンドレベルの補正、コマンドチャネルで症状を抑える処置はいずれも成功率を回復できなかったが、学習ストリームの半分を展開分布の教師ロールアウトに置き換える最小対ペア介入は、18/36で教師の17/36に並び、症状を消し去った。

Key Facts

Octo-Baseを8層に蒸留した圧縮操作方策は、パラメータの86%を保持した。[1]
ファミリー固有の検証指標では0.996と1.000のteacher-ratioでオフラインチェックを通過した。[1]
シミュレーションのWidowXピック&プレース課題では学生モデルが0/72、教師モデルが40/72だった。[1]
物体移動は教師の90%の速度、把持は55%の水準だったが、目標への搬送は全変種で0%だった。[1]
学習ストリームの半分を展開分布の教師ロールアウトに置き換える介入で、18/36と17/36の持ち越し結果になった。[1]

本紙の見方

この論文の新しさは、圧縮VLA方策が「オフラインで通るのに閉ループで落ちる」という既知の一般論を、Octo-Baseの8層蒸留という具体例で因果的に切り分けた点にある。86%のパラメータ保持、0.996と1.000のteacher-ratio、0/72という結果を並べると、評価指標の合格と実行成功が同じものではないことがはっきりする。つまり焦点はモデル規模の縮小そのものではなく、縮小後に残る行動分布のずれと、閉ループで増幅される局所的な破綻である。 特に重要なのは、失敗が「途中までは動くが最後で落ちる」という構造を持つ点だ。物体移動90%、把持55%、搬送0%という段階差は、単なる性能低下ではなく、操作系列の後半で破綻が集中していることを示す。ここから、オフライン指標が観測しにくいのは総合成功率だけではなく、遅い時点の残差やコマンド応答の非対称性であると読める。標準的介入が4つとも失敗した事実も、学習を少し足す、データを少し足す、命令側を少し補正するという対症療法では足りないことを示している。 一方で、学習ストリームの半分を展開分布の教師ロールアウトに差し替えると18/36まで戻った点は、閉ループ失敗の本体が「実行分布に触れていない」ことにある可能性を示唆する。ただし著者ら自身が「存在を示すのであって普遍性は主張しない」としている通り、この結果を一般化するのは早い。次に確認すべきは、どの規模の圧縮やどの種類の操作タスクで同様のz残差が再現するか、また閉ループ試験を受け入れ条件に組み込んだ場合に、どの程度の試行回数でこの種の破綻を検出できるかである。

なぜ重要か

著者らの結果は、ロボット操作モデルの合否判定をオフライン指標だけで済ませる設計に注意が必要だと示している。特に圧縮後の方策では、検証指標が良くても閉ループでの物体搬送のような終盤工程が崩れる可能性があり、実機相当の試験条件をどう入れるかが課題になる。

日本への影響

日本では、ロボット操作向けの学習データや評価手順を設計する際に、オフライン検証と閉ループ試験を分けて扱う必要性が高まるとみられる。とくに把持後の搬送のような後半工程を、どの段階で検出・評価するかが焦点になる。