何が起きたか

arxiv.orgは2026-09-25、FRAM(Future Representation Action Model)というロボット操作向けモデルを掲載した。FRAMは138.7Mパラメータで、凍結した言語エンコーダを含みつつ、未来のエンドエフェクター軌道と現在の視覚入力を結びつける小型ポリシーである。4つの標準LIBEROスイートで平均成功率92.2%を示し、3.3Bパラメータのπ_0の94.2%に近い水準だった。

詳細

FRAMは、予測した軌道の画像座標を空間的な指標として用い、現在画像からその動きに関係する局所的な視覚特徴を読む設計である。情報はReference position(Where)、visual state(What)、future motion(Future)に整理され、軌道ラベルはデモンストレーションとカメラ幾何から自動生成されるため、手作業の注釈は不要としている。 追加学習なしではLIBERO-Plusで平均67.3%に達した。アブレーションでは、未来の軌道と局所視覚特徴の双方が性能とロバスト性を高めることが確認された。実機では、両腕のUR5eで、手首カメラのみを使ってカップ積みを実行し、左右の腕の選択と切り替えも含まれていた。

Key Facts

FRAM(Future Representation Action Model)は、未来のエンドエフェクター軌道を現在の視覚入力に結びつける小型ポリシーである。[1]
FRAMは138.7Mパラメータで、凍結した言語エンコーダを含む。[1]
4つの標準LIBEROスイートで平均成功率92.2%を示した。[1]
比較対象として、3.3Bパラメータのπ_0は平均94.2%だった。[1]
実機の両腕UR5eで、手首カメラのみを使ったカップ積みを行い、左右の腕の選択と切り替えも扱った。[1]

本紙の見方

FRAMの新規性は、ロボット操作の視覚表現を「現在の画像をどう読むか」だけでなく、「これからエンドエフェクターがどこへ動くか」を手がかりに選ぶ点にある。138.7Mパラメータという規模で、4つのLIBEROスイート平均92.2%を示し、3.3Bパラメータのπ_0の94.2%に近づいたことは、単純な大型化以外の設計で性能を取りにいく方向を示す。ただし、ここで示されたのは標準ベンチマークと実機の一部タスクであり、汎用的な置換可能性まではまだ読めない。 本紙の見方としては、FRAMは「言語条件付き操作モデル」の中でも、言語を主役に置くというより、軌道予測を軸に視覚特徴を選別する構造に重心がある。Where/What/Futureという分解は、入力の全部を一律に食わせる方式よりも、必要な局所情報だけを拾う設計である。 業界構造への含意としては、学習データの作り方が重要になる。FRAMは軌道ラベルをデモンストレーションとカメラ幾何から自動生成できるとしており、手動注釈の負担を下げる設計だ。一方で、両腕UR5eと手首カメラという実験条件が示すのは、実機で効くかどうかがセンサー配置と軌道表現に強く依存する可能性である。今後は、LIBERO系ベンチマークの外でも同じ構成が成り立つか、追加学習なしの67.3%がどの範囲まで維持されるか、そして左右腕の切り替えや対象物の違いに対してどこまで一般化するかが焦点になる。

なぜ重要か

FRAMは、138.7Mパラメータで92.2%という結果を示し、より大きい3.3Bパラメータのπ_0に近づいたとされるため、ロボット操作で必ずしも巨大モデルだけが選択肢ではないことを示す。論文では、デモンストレーションとカメラ幾何から軌道ラベルを自動生成できるとしており、学習データ整備の負荷を下げられる可能性がある。