何が起きたか

2025年3月6日、arXivにプレプリント「Refined Policy Distillation: From VLA Generalists to RL Experts」が公開された。研究チームは、汎用性の高いVLAを、RLを用いて高性能な専門家ポリシーへ蒸留する手法RPDを提案し、ManiSkill3環境でOctoとOpenVLAのファインチューニング版を用いて評価した。実験では、RPDが密・疎な報酬設定の両方でVLA教師を上回る性能を示した。

詳細

RPDは、教師VLAの行動をガイドに用いるオン方策RLと行動クローニングを組み合わせた手法である。これにより、RL探索中のサンプル効率が向上し、収束が速くなるとされる。実験はManiSkill3シミュレーション環境で実施され、OctoとOpenVLAのファインチューニング版が教師として使用された。結果、RPDは密報酬・疎報酬の両設定でVLA教師を上回る専門家ポリシーを学習し、RLベースラインよりも速く収束した。さらに、カメラ視点の変化に対して頑健で、基盤となるVLAが解決できないタスク変動にも一般化できると報告されている。コード、データセット、VLAチェックポイント、動画はプロジェクトページで公開されている。

Key Facts

論文「Refined Policy Distillation: From VLA Generalists to RL Experts」がarXivに2025年3月6日に公開された。[1]
RPDはオン方策RLと行動クローニングを組み合わせ、教師VLAの行動を利用して学生ポリシーを蒸留・洗練する。[1]
ManiSkill3環境でOctoとOpenVLAのファインチューニング版を用いて評価された。[1]
実験では、RPDが密報酬・疎報酬の両設定でVLA教師を上回る性能を示し、RLベースラインより速く収束した。[1]
RPDはカメラ視点の変化に頑健で、基盤VLAが解決できないタスク変動にも一般化できると報告されている。[1]

なぜ重要か

VLAはロボットの汎用制御に期待される一方、実用には専門性の高いポリシーへの変換が不可欠である。RPDは、RLと行動クローニングの組み合わせにより、VLAの知識を効率的に専門家ポリシーへ蒸留する手法を提供し、ロボット学習の実用化を前進させる可能性がある。今後の実世界での検証が、この手法の有効性を左右するだろう。