何が起きたか

arxiv.orgは2026-10-04、VAMPS: Visual and Motor Policies from Sampling-Based Planningを公開した。VAMPSは、Model Predictive Path Integral(MPPI)制御を使い、人的デモなしで再利用可能なロボット方策を学習する枠組みである。実験では、学習した移動方策をUnitree Go2に転移し、視覚・操作方策ではFlexiv Rizon 10S上で収集したデータを用いた。

詳細

VAMPSは2つの学習モードを持つ。1つは単一ステップの自己状態方策で、シミュレーション内で反復的に学習する方式である。方策がMPPIをウォームスタートし、洗練された軌跡が新たな教師信号となる。終端価値の学習とImplicit Q-Learning(IQL)のcriticが、短期計画と方策更新を支える。 もう1つは視覚・操作方策で、実機データから直接学習する。MPPIはタスク固有の状態推定を使って軌跡を計画・実行し、その過程でRGB観測とセンサー観測をFlexiv Rizon 10Sから記録する。Action Chunking with Transformersが行動チャンクを予測し、実効予測ホライズンを短くしている。デモでは、視覚・操作のピック&プレースと、測定した6-D wrenchと目標法線力を追加で観測する力対応のホワイトボード消去を示した。

Key Facts

VAMPSはModel Predictive Path Integral(MPPI)制御を使って、人的デモなしで再利用可能なロボット方策を学習する枠組みである。[1]
単一ステップの自己状態方策は、シミュレーション内で反復的に学習する。[1]
学習した移動方策はUnitree Go2に転移された。[1]
視覚・操作方策はFlexiv Rizon 10S上で収集した実ロボットデータから学習された。[1]
デモとして、視覚・操作のピック&プレースと、6-D wrenchと目標法線力を観測する力対応のホワイトボード消去が示された。[1]

本紙の見方

VAMPSの新規性は、単に模倣学習やオフライン学習を並べたものではなく、MPPIを学習ループの中核に置いて方策を更新し、その結果を再利用可能な形に戻している点にある。自己状態方策ではシミュレーション反復、視覚・操作方策ではFlexiv Rizon 10Sからの自律収集データと、同じ枠組みの中で学習経路を分けている。つまり、計画器が教師であり、同時にデータ生成装置にもなっている構造である。 本紙の関連記事として見ると、松延動力、智元機器人、宇樹科技が相次ぎ具身智能モデルを公表 が示したのは、中国勢が具身智能モデルを相次いで打ち出している流れである。そこではモデルの発表自体が主題だったが、VAMPSはモデル単体よりも、MPPI、IQL、Action Chunking with Transformers、実機データ収集を接続した学習手順に焦点がある。研究競争の軸が、モデル名の提示から、どのデータと制御則で再現可能な方策を作るかへ移っていることを示す材料とみられる。 業界構造への含意としては、まず計画と学習の境界が薄くなる点が大きい。MPPIが軌跡生成を担い、その出力が教師信号になるため、実機デモの取得コストや危険を抑えつつ、シミュレーションと実機の往復で方策を磨く設計が可能になる。次に、Flexiv Rizon 10Sのような実機からRGBとセンサー観測、さらに6-D wrenchまで扱えることは、操作タスクの学習に必要な入力が視覚だけでは足りないことを示す。加えて、Unitree Go2への転移が示されたことで、学習対象が単一機体に閉じていないことも分かる。 未確定の論点は、VAMPSがどの程度の汎用性で他機種・他タスクへ広がるか、またMPPIやIQL、Action Chunking with Transformersの各要素の寄与がどこにあるかである。論文要旨だけでは、学習データ量、評価回数、失敗率、実機での安定運用条件は分からない。Unitree Go2とFlexiv Rizon 10S以外への移植性、ならびに力対応タスクで必要なセンサ構成の最小条件が次の確認点になる。

なぜ重要か

VAMPSは、人的デモに依存せずに方策を作る手順を示しており、ロボット学習の実験設計を変える可能性がある。発表内容上、Flexiv Rizon 10Sの観測とUnitree Go2への転移が含まれるため、移動とマニピュレーションを別々の系としてではなく、計画と学習の接続問題として扱う必要があると分かる。