何が起きたか

arXivは2026年10月6日、48.9Mパラメータのロボット操作方策CoRP(Compressed Representation Policy)を報じた。論文は、Vision-Language Modelや動画生成事前学習を使わず、表現抽出器とflow-matching型の行動生成器に分けた設計で、LIBEROで97.0%、RoboTwin 2.0のClean/Randomizedで75.78%/73.36%を示した。著者らは、比較可能な既存システムより40.9〜163.6倍小さい規模で同水準に達したとしている。

詳細

論文では、行動生成器を固定したまま表現抽出器の条件を1つずつ変え、性能差の要因を切り分けた。LIBEROでは、ランダム初期化のViT-S/14にすると78.1%、ImageNet事前学習のResNet-34では74.5%まで下がり、さらにエンコーダを凍結すると19.8ポイント失った。 圧縮条件も重要だった。各視点を48トークンに再サンプリングすると、全パッチトークンを通す場合の83.2%を上回る97.0%となった。一方、これらのトークンに変分情報ボトルネックをかけると、LIBERO-Goalは95.8%から33.0%へ低下した。言語条件は、観測だけでは目標が曖昧なLIBERO-Goalでは9.2%から95.8%へ効いたが、観測が明確なRoboTwin 2.0では外した方がやや良かった。

Key Facts

arXivの論文題目は「Compact Robot Policies Need Fine-Grained Visual Representations」である。[1]
CoRP(Compressed Representation Policy)は48.9Mパラメータで、Vision-Language Modelと動画生成事前学習を使わない。[1]
CoRPはLIBEROで97.0%、RoboTwin 2.0 Clean/Randomizedで75.78%/73.36%を記録した。[1]
著者らは、比較対象より40.9〜163.6倍小さい規模でも同等の性能だとしている。[1]
各視点を48トークンに再サンプリングすると、LIBEROで97.0%となり、全パッチトークンの83.2%を上回った。[1]

本紙の見方

この論文の新しさは、小型方策そのものの有効性ではなく、性能差の主因を「モデル規模」や「生成事前学習」ではなく視覚表現に置き直した点にある。48.9Mパラメータというコンパクトさは印象的だが、論文の結果は単純な軽量化の成功例ではない。むしろ、表現抽出器の初期化、凍結の有無、トークン数の圧縮方法といった入力側の設計が、行動生成器の固定下でも性能を大きく揺らすことを示している。 とくに重要なのは、同じCoRPでも条件によって結果が大きく変わる点である。ランダム初期化のViT-S/14で78.1%、ImageNet事前学習のResNet-34で74.5%まで落ち、エンコーダ凍結で19.8ポイント失うという数字は、事前学習済みであることだけでは足りず、タスクへの適応が必要だと読むべきだろう。さらに、48トークンへの再サンプリングが83.2%から97.0%へ改善し、変分情報ボトルネックでLIBERO-Goalが95.8%から33.0%へ崩れる結果は、情報を広く残すより、指示に応じたトークン選択を維持した圧縮が効くことを示唆する。 この点は、ロボット政策の競争軸を「大規模化」から「表現の設計」に移す含意を持つ。特に、観測が曖昧なLIBERO-Goalでは言語条件が9.2%から95.8%へ効く一方、観測が明確なRoboTwin 2.0では外した方がわずかに良いという結果は、言語を常時足す設計が万能でないことを示している。本紙としては、今後の焦点は、48トークンという設定の再現性、他のベンチマークでも同じ圧縮則が成り立つか、そしてこの抽出器設計が実機や長期タスクでも維持されるかにあるとみる。

なぜ重要か

この論文は、ロボット操作で必要なのが単純なパラメータ増ではなく、観測をどう圧縮し、どの情報を残すかだと示した。CoRPは48.9Mパラメータで、96%台の成功率を達成しており、計算資源を抑えながらも高性能を狙う設計の条件を具体化している。

日本への影響

日本のロボット研究や製造現場にとっては、機体やアクチュエータだけでなく、視覚表現の設計とトークン圧縮が性能差を左右するという示唆がある。とくに、少ない計算資源で動かす前提の実機開発では、モデルの大型化よりも、観測の取り方と圧縮方法を詰めることが焦点になりうる。