何が起きたか
研究者らは、拡散・フローマッチングポリシーを推論時にQ値勾配でステアリングする手法QPILOTSを提案した。標準的なオフラインからオンラインへのRLベンチマークで、50タスクの平均成功率90%を達成した。
詳細
QPILOTSは、元のポリシーを変更せず、推論時の各デノイジングステップで、中間状態を最終クリーンアクションの推定値に投影し、その点でクリティックの勾配を計算する。QPILOTS-Uは高速な一点近似、QPILOTS-Mは学習済み補助ネットワークによる事後サンプリングを用いる。大規模な事前学習済みVLA基盤モデルにも適用し、6つの操作タスクで既存の推論時手法を上回るか同等の性能を示した。
Key Facts
| QPILOTSは、拡散・フローマッチングポリシーを推論時にQ値勾配でステアリングする手法である。 | [1] |
| QPILOTSは、中間状態を最終クリーンアクションの推定値に投影し、クリティックの勾配を計算する。 | [1] |
| QPILOTS-Uは高速な一点近似、QPILOTS-Mは学習済み補助ネットワークによる事後サンプリングを用いる。 | [1] |
| 標準的なオフラインからオンラインへのRLベンチマークで、50タスクの平均成功率90%を達成した。 | [1] |
| 大規模な事前学習済みVLA基盤モデルに適用し、6つの操作タスクで既存の推論時手法を上回るか同等の性能を示した。 | [1] |
なぜ重要か
QPILOTSは、拡散ポリシーのRL最適化における勾配不安定性という根本課題に対し、推論時ステアリングという軽量な解決策を示した。これにより、大規模な事前学習済みモデルを追加学習なしで改善できる可能性が広がり、ロボット学習の実用化を後押しする。