何が起きたか
arXivは2026-09-26、Copper-Policyというロボット操作向け手法を公開した。論文は、将来のシーンをピクセルや潜在空間で詳細に予測する代わりに、政策とともにコンパクトな世界表現を学ぶ設計を提案している。モデル規模は2Bパラメータで、8×RTX 5090 GPUを使い9.67時間で学習したとしている。
詳細
Copper-Policyは、Temporal joint-embedding predictionにより、タスク意図に条件づけた未来の観測埋め込みを再構成なしで予測する。論文では、この予測と行動デコードが表現を共同で形づくり、政策は実行時に現在フレームの空間的詳細へアクセスできると説明している。 性能面では、RoboTwinで埋め込み事前学習なしの比較手法を上回り、LIBERO-Plusでは複数の実世界埋め込み事前学習済みVLAを上回って80.85%を記録したとしている。さらに、3つの実機課題でπ_{0.5}と同程度の性能を示し、平均スコアではより高かったと述べている。
Key Facts
| Copper-Policyは、World Action Models(WAMs)向けに、画像再構成ではなくコンパクトな世界表現を政策とともに学ぶ手法である。 | [1] |
| 論文は、2Bパラメータのモデルを8×RTX 5090 GPUで9.67時間学習したと述べている。 | [1] |
| Compact prediction targetsにより、Fast-WAMと比べて学習速度は6倍だったとしている。 | [1] |
| Copper-PolicyはRoboTwinで比較手法を上回り、LIBERO-Plusで80.85%を記録したとしている。 | [1] |
| 3つの実機課題で、Copper-Policyはπ_{0.5}と同程度の性能を示し、平均スコアはより高かったとしている。 | [1] |
本紙の見方
Copper-Policyの新しさは、ロボット操作のための世界モデルを「何を再構成するか」ではなく「どの表現が制御に効くか」から設計している点にある。ピクセルや潜在空間の詳細な未来生成を避け、タスク意図付きの未来埋め込み予測に絞ることで、表現学習と行動デコードを同じ枠内で進めている。これはWAMの延長線上にあるが、生成中心の設計から圧縮表現中心へ重心を移した点が特徴だとみられる。 数値面では、2Bパラメータを8×RTX 5090で9.67時間学習し、Fast-WAM比で6倍高速とされる。ここで重要なのは、性能指標だけでなく、学習トークンをサンプル当たりで削減できる設計が、訓練計算量そのものを抑えている点である。大規模なロボット基盤モデルの議論では、精度と同時に学習コストが導入障壁になるため、Copper-Policyは制御性能と訓練効率を同時に示す構図になっている。 一方で、論文が示しているのはベンチマークと限定的な実機課題での結果であり、汎用的な量産システムの成立を直ちに意味するものではない。RoboTwin、LIBERO-Plus、3つの実機課題という評価範囲は明確だが、長時間運用での安定性、タスク追加時の再学習コスト、入力の違いに対する頑健性、そして表現の圧縮がどこまで複雑な環境で維持されるかは次の確認点になる。加えて、Fast-WAMやπ_{0.5}との比較はあるものの、同一条件でのデータ量、実機構成、学習レシピの差は本文だけでは読み切れず、比較の厳密性が焦点になる。
なぜ重要か
論文の主張が正しければ、ロボット操作モデルは高精細な未来生成を必須とせずに学習できることになる。これは、計算資源を抑えつつ制御性能を確保したい研究開発にとって意味がある。発表元であるarXiv論文は、2Bパラメータと8×RTX 5090、9.67時間、LIBERO-Plus 80.85%という具体値で、その効率と性能を示している。
日本への影響
日本のロボット研究・開発にとっては、GPU計算資源を大量に使う生成型世界モデルよりも、制御に必要な表現へ学習を絞る設計が、検証コストを下げる選択肢になりうる。特に、実機3課題のように現場での評価を重視する開発では、再構成よりも制御表現を優先する発想が、学習データや計算資源の制約がある環境で検討対象になりそうだ。