何が起きたか
CAPEXは2026年9月26日、汎用マルチモーダル基盤モデルの行動を、実機に投入できるロボット方策へ蒸留する枠組みを公表した。人間の遠隔操作によるデータ収集の代わりに、基盤モデル自身を自律デモンストレータとして使い、試行経験に応じて観察・推論・再計画の頻度を調整する。RoboCasaの課題に加え、Frankaと両腕のYAM-arm実機で評価し、成功率、モデル呼び出し回数、トークン使用量、収集時間、コストを測定した。
詳細
著者らは、CAPEXが「experience-conditioned demonstration collection framework」であると説明している。基盤モデルはゼロショットの操作軌跡を生成できる一方、実行中に何度も呼び出すと速度とコストが制約になるため、CAPEXでは過去の試行経験を入力にして、モデルをどの頻度で観察・推論・再計画させるかを変える設計を採っている。 評価では、RoboCasaのタスク群、Franka、bimanual YAM-armを用い、下流学習ではDiffusion PolicyとACTを、人間遠隔操作デモと基盤モデル生成デモの両方で学習させて比較した。結果として、CAPEX生成データは成功デモ数を4.3倍に増やし、成功1件あたりのコストを80%削減した。
Key Facts
| CAPEXは、汎用マルチモーダル基盤モデルを自律デモンストレータとして使い、ロボット方策へ蒸留する枠組みである。 | [1] |
| 論文は2026年9月26日に公開された。 | [1] |
| 評価対象はRoboCasaのタスク、Franka、bimanual YAM-armである。 | [1] |
| 下流学習ではDiffusion PolicyとACTを用い、人間遠隔操作デモと基盤モデル生成デモを比較した。 | [1] |
| CAPEXは成功デモ数を4.3倍に増やし、成功1件あたりのコストを80%削減した。 | [1] |
本紙の見方
CAPEXの新しさは、ロボット学習におけるデータ収集の主体を人間から基盤モデルへ置き換えつつ、実行経験に応じてモデルの介入頻度を変える点にある。単なる生成モデルの適用ではなく、観察・推論・再計画の回数を経験条件で制御するため、同じ基盤モデルでもデータ生成の効率を上げる設計になっている。ここは、従来の遠隔操作収集をそのまま代替する発想とは異なる。 本紙の過去報道との接続はないが、公開情報として読むと、今回の焦点は「基盤モデルがロボットの頭脳になれるか」ではなく、「その基盤モデルを、学習用データを安く増やす装置としてどう運用するか」にある。RoboCasaに加えてFrankaとbimanual YAM-armを使っている点は、シミュレーションだけでなく実機での行動生成と再計画の往復を見ていることを示す。Diffusion PolicyとACTの両方で検証しているため、特定の学習手法に閉じない下流効果の確認も意図しているとみられる。 業界構造への含意は、ロボット性能の差がモデル単体よりも、どのように経験を集めて再利用するかに移りうる点だ。人手の遠隔操作に依存したデータ収集は、時間と費用が積み上がる一方、CAPEXは成功デモの増加とコスト削減を同時に示したため、学習データの供給網そのものを再設計する議論につながる。加えて、モデル呼び出し回数、トークン使用量、収集時間を同時に見る設計は、性能だけでなく運用コストと実行速度がボトルネックになることを明確にしている。 未確定の論点は、CAPEXがどの規模の学習データ量で効果を維持するか、どのタスクで効果が縮むか、長期運用時にどれだけ再現性があるかである。論文は成功デモ数とコスト削減を示しているが、具体的なモデル規模、計算資源、実運用でのスループットや安全性の制約は本文からは読み切れない。今後は、より広いタスク群での頑健性と、実機導入時の総コストが焦点になる。
なぜ重要か
人間の遠隔操作ではなく基盤モデルをデモ収集に使うと、ロボット学習のボトルネックが「人を何時間つなげるか」から「モデルを何回、どの条件で呼ぶか」に移る。CAPEXは、成功デモ数を4.3倍、成功1件あたりコストを80%下げたと主張しており、発表元の論文が示す限り、学習データの集め方そのものを変える可能性がある。 Frankaとbimanual YAM-armでの検証は、少なくとも複数の実機構成でこの枠組みを試していることを示す。どのタスクで同じ改善が続くか、またDiffusion PolicyとACT以外の学習法でも同様かが次の確認点になる。