何が起きたか
研究者らは、凍結した生成ポリシーをノイズ空間で摂動させる軽量適応手法LP-DSを提案した。RoboMimic操作、OpenAI Gym locomotion、Adroit器用操作の各ベンチマークで、サンプル効率・成功率・報酬を改善し、報酬は従来ベースライン比で最大25%向上した。
詳細
LP-DSは、凍結された生成ポリシーの潜在ノイズ空間に摂動を学習し、デコード前に適用する。ラグランジュ信頼領域目的を用いて、下流の価値を最適化しつつ潜在事前分布からの乖離を制約する。評価では、拡散ポリシーに加え、フローマッチングバックボーン、大規模視覚言語行動モデル、実機Franka展開でも有効性を示した。
Key Facts
| LP-DSは凍結生成ポリシーをノイズ空間摂動で適応させる軽量手法である。 | [1] |
| RoboMimic、OpenAI Gym、Adroitの各ベンチマークでサンプル効率・成功率・報酬を改善した。 | [1] |
| 報酬は従来ベースライン比で最大25%向上した。 | [1] |
| フローマッチングバックボーン、大規模視覚言語行動モデル、実機Franka展開でも有効性を確認した。 | [1] |
なぜ重要か
LP-DSは、生成ポリシーの凍結と軽量適応を両立する手法として、ロボット学習の実用化に寄与する可能性がある。特に、大規模モデルを効率的に活用する道を開く点で、今後の基盤モデル応用の方向性を示唆している。