何が起きたか

arXiv掲載の論文「PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies」は、直接型のvision-language-action policyに対し、予測学習と価値に基づく方策改善を組み合わせる手法を2026-08-31に公表した。学習では、固定オフセットのJEPA目的に加え、残りエピソードの25%、50%、75%、100%地点での多時間軸の遷移整合を導入する。著者らは、3つのシミュレーションベンチマークで最良の総合性能を示したとしている。

詳細

手法は、まず局所的な固定オフセットJEPAの目的を維持しつつ、現在の方策表現が短期の物理変化と長期のタスク進行の両方を保持するように設計されている。加えて、残りエピソードに対する25%、50%、75%、100%の4点での遷移整合を、学習時のみのターゲットとして与える。これは、action headに明示的な未来トークンを渡さずに、長い時間軸の進行を表現に持たせる狙いである。 方策改善の段階では、独立した分布的価値criticを累積デプロイ軌跡で学習し、action-chunkに整合するN-step advantageを計算する。その結果を、flow-matching actorに対する正・負・中立のテキスト条件へ変換する。論文は、これにより有効な軌跡が「物理的に何が起きたか」を教えられ、相対的に良い行動に対応する条件の下でのみactorを動かせるとしている。なお、多時間軸予測器とcriticはオンライン実行から取り除かれ、現在の観測、言語指示、proprioceptionから直接行動を生成する経路は維持される。

Key Facts

PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies[1]
2026-08-31にarXivで公開された[1]
fixed-offset JEPA目的に加えて、25%、50%、75%、100%地点でのmulti-horizon transition alignmentを導入した[1]
独立したdistributional value criticと、action-chunk-aligned N-step advantagesを用いた[1]
3つのsimulation benchmarksで最強のoverall performanceを示したとしている[1]

本紙の見方

この論文の新規性は、直接型のvision-language-action policyを保ちながら、学習時だけに予測器と価値criticを足す点にある。実行時の経路は現在の観測・言語指示・proprioceptionからの直接生成に固定し、補助モジュールは外す。つまり、推論系を複雑化させずに、学習段階でだけ「短期の物理変化」と「長期のタスク進行」を表現に押し込む設計である。ここで重要なのは、単なる行動模倣の強化ではなく、軌跡の質に応じて正・負・中立の条件を与え分ける点である。 本紙の観点では、これは同じ直接制御系でも「何を入力にするか」ではなく「どの軌跡をどう再利用するか」を主題に移している。25%、50%、75%、100%という4つの残存比率を明示して遷移整合を置いたことは、短期の姿勢制御だけでなく、タスク進行の途中経過を表現に残す意図を示す。加えて、累積デプロイ軌跡から分布的価値criticを学習し、N-step advantageをテキスト条件へ変換する構成は、成功軌跡の全部を同列に扱わず、相対的に良い行動だけをactorの条件に使う選別機構と読める。これは、ロボット制御の学習における「軌跡の再利用」を、単純な模倣から価値ベースの編集へずらす設計である。 本紙の関連記事はないため、既報との接続はない。業界構造への含意としては、オンライン実行の軽さを保ちながら学習時にのみ追加信号を使うため、推論計算の増加を抑えたい直接制御系に適する可能性がある。一方で、論文が示したのは3つのシミュレーションベンチマークでの成績であり、実機で同じ構成がどこまで維持されるかは別論点である。さらに、distributional value criticで用いた累積軌跡の品質評価、N-step advantageの定義、正・負・中立のテキスト条件がどの程度タスク一般に通用するかは未確定である。次に確認すべきは、実機転移の有無、ベンチマークごとの改善幅、そして学習に必要なデータ量と軌跡選別の基準である。

なぜ重要か

この手法が示すのは、ロボットの推論経路を重くせずに、学習時だけ軌跡の質を使って方策を鍛える設計である。論文では、学習用の予測器とcriticを実行時に外しつつ、3つのシミュレーションベンチマークで最良性能を主張しており、低遅延の直接制御系を重視する開発に関係する。