何が起きたか
研究者らは、拡散・フローマッチングポリシーを推論時にQ値勾配でステアリングする手法QPILOTSを提案した。標準的なオフラインからオンラインへのRLベンチマークで、50タスクの平均成功率90%を達成した。
詳細
QPILOTSは、元のポリシーを変更せず、推論時の各デノイジングステップで、中間状態を最終クリーンアクションの推定値に投影し、その点でクリティックの勾配を計算する。QPILOTS-Uは高速な一点近似、QPILOTS-Mは学習済み補助ネットワークによる事後サンプリングを用いる。大規模な事前学習済みVLA基盤モデルにも適用し、6つの操作タスクで既存の推論時手法を上回るか同等の性能を示した。
Key Facts
| QPILOTSは、拡散・フローマッチングポリシーを推論時にQ値勾配でステアリングする手法である。 | 出典一覧 |
| QPILOTSは、中間状態を最終クリーンアクションの推定値に投影し、クリティックの勾配を計算する。 | 出典一覧 |
| QPILOTS-Uは高速な一点近似、QPILOTS-Mは学習済み補助ネットワークによる事後サンプリングを用いる。 | 出典一覧 |
| 標準的なオフラインからオンラインへのRLベンチマークで、50タスクの平均成功率90%を達成した。 | 出典一覧 |
| 大規模な事前学習済みVLA基盤モデルに適用し、6つの操作タスクで既存の推論時手法を上回るか同等の性能を示した。 | 出典一覧 |
本紙の見方
本手法の新規性は、既存の拡散ポリシーRL最適化が直面する数値的不安定性を、推論時のステアリングで回避する点にある。従来は勾配情報を捨てるか、単一ステップアクターへの蒸留、またはクリティック改善に伴う再微調整が必要だったが、QPILOTSは元のポリシーを変更せず、デノイジング過程を直接操る。これにより、学習済みの大規模VLAモデルにも適用可能で、追加学習なしで性能向上が期待できる。業界への含意として、ロボット操作タスクにおける基盤モデルの活用が進む中、推論時最適化は計算コストを抑えつつ性能を引き出す有力な方向性となる。未確定の論点は、実機での性能、計算オーバーヘッド、そしてクリティックの品質がステアリング結果に与える影響である。
なぜ重要か
QPILOTSは、拡散ポリシーのRL最適化における勾配不安定性という根本課題に対し、推論時ステアリングという軽量な解決策を示した。これにより、大規模な事前学習済みモデルを追加学習なしで改善できる可能性が広がり、ロボット学習の実用化を後押しする。