何が起きたか

arXivは2026-09-18付で、接触を伴う操作向けの新手法「Predictive Sensorimotor Representation(PSR)」を公開した。論文は、多感覚のセンサモータ信号から未来の相互作用ダイナミクスを予測する階層的表現を学習し、それを視覚・言語・行動ポリシーの行動ストリームに統合する枠組みを提案している。著者らはこの手法をVLAモデルに実装したPSR-VLAを6つの実世界タスクで評価し、総合成功率91.7%を示したと報告した。

詳細

論文では、事前学習段階でマルチモーダルTransformerを用い、未来の相互作用ダイナミクスを共同予測することで階層的な予測表現を学ぶ。その後、学習した階層を行動ストリームに加えることで、接触に関する手がかりを複数の深さで利用できるようにする設計である。 評価では、PSR-VLAは6つの実世界の接触豊富な操作タスクで91.7%の総合成功率を記録した。論文は比較対象としてπ0.5、ForceVLA-π0.5、ForceVLA2-π0.5を挙げ、それぞれに対して30.0、22.5、19.2ポイント上回ったとしている。

Key Facts

arXiv掲載の論文「PSR: Predictive Sensorimotor Representation Learning for Contact-Rich Manipulation」が2026-09-18に公開された。[1]
PSRは、多感覚センサモータ信号から階層的な予測表現を学習し、行動ストリームに統合する枠組みである。[1]
事前学習ではマルチモーダルTransformerが未来の相互作用ダイナミクスを共同予測する。[1]
PSRをVLAモデルに実装したPSR-VLAは、6つの実世界接触操作タスクで評価された。[1]
PSR-VLAの総合成功率は91.7%で、π0.5、ForceVLA-π0.5、ForceVLA2-π0.5をそれぞれ30.0、22.5、19.2ポイント上回った。[1]

本紙の見方

今回の論文で新しいのは、接触を伴う操作を「見えている物体の認識」ではなく、接触力・ロボット状態・相互作用履歴を先読みする表現学習として扱った点である。既定路線の延長にあるのは、VLAモデルへ情報を足して行動を改善する発想だが、PSRはその入力を受動的な力フィードバックではなく、将来の相互作用ダイナミクスの予測に置き換えている。ここが単なるマルチモーダル拡張ではなく、接触時の制御に必要な時系列の内部表現を前面に出した点だとみられる。 本紙の関連記事はないため、過去報道との連続性は外部から補えない。ただ、論文内の比較対象にForceVLA系とπ0.5系が置かれていることから、PSR-VLAは既存の視覚言語行動モデル群の延長線上で性能差を測った研究だと読める。比較で30.0ポイント、22.5ポイント、19.2ポイントという差が示された一方、実験は6タスクに限られており、接触の難しさをどこまで一般化できるかはまだ確認が必要である。 業界構造への含意としては、ロボット操作の価値が画像認識の精度だけではなく、力覚や接触履歴をどう表現して行動に結びつけるかに移っている点が大きい。つまり、入力はカメラだけでなく触覚・力覚・ロボット状態へ広がり、処理は予測表現、出力は行動ストリームという構造になる。ここで焦点になるのは、学習に使ったセンサ構成、6タスクの内訳、推論時の遅延、実機での安定性である。論文は動画と安定性テストの公開先を示しているが、どの条件で成功率が維持されるか、失敗例がどのタイプの接触に集中するかは追加確認が要る。

なぜ重要か

接触を伴う実機操作では、視覚だけでなく力覚や相互作用履歴を取り込めるかが精度を左右する。論文は、PSR-VLAが6つの実世界タスクで91.7%の成功率を示したと報告しており、接触を伴う作業での行動生成に必要な情報設計の焦点が見える。

日本への影響

日本のロボット分野では、力覚センサー、触覚センサー、産業用マニピュレータの制御ソフトがこの種の手法の前提になる。論文が接触ダイナミクスの予測を重視している以上、学習用データをどう集めるか、実機でどのセンサ構成を組めるかが競争条件になるとみられる。