何が起きたか

研究者らは、強化学習の探索手法として、プロンプトを書き換えることで方策の大域的な変化を誘発する「Prompt-Driven Exploration(PDE)」を提案した。PDEは、報酬が得られない初期状態からでも方策学習を成功させ、サンプル効率を向上させるとしている。論文はarXivに2026年7月9日に公開された。

詳細

PDEは、ロールアウト動画をVLMが分析し、方策の応答を診断してプロンプトを書き換えることで、次回の行動を改善する。この手続きは、プロンプトレベルでの事後サンプリングに類似し、VLMが有用なプロンプトの暗黙的な分布を維持し、観測されたロールアウトから更新する。操作タスクと推論タスクの両方で、ゼロ報酬からの学習を可能にし、サンプル効率を向上させた。

Key Facts

研究者らは、強化学習の探索手法としてPrompt-Driven Exploration(PDE)を提案した。[1]
PDEは、ロールアウト動画をVLMが分析し、プロンプトを書き換えることで方策の大域的な変化を誘発する。[1]
PDEは、報酬がゼロの状態からでも方策学習を可能にし、サンプル効率を向上させるとしている。[1]
論文はarXivに2026年7月9日に公開された。[1]

なぜ重要か

PDEは、報酬が得られない初期状態からの学習を可能にするため、実世界のロボット学習や複雑な推論タスクにおける強化学習の適用範囲を広げる可能性がある。また、LLMやVLMをRLに統合する新たな枠組みとして、今後の研究の方向性を示すものと言える。