何が起きたか

arXivに2025年4月21日付で掲載された論文(識別番号2504.15472v1)において、研究者らはLarge Language Model-Assisted Preference Prediction(LAPP)という新しいロボット学習フレームワークを発表した。LAPPは、強化学習中に収集された生の状態-行動軌跡からLLMが自動的に選好ラベルを生成し、オンライン選好予測器を訓練する。これにより、人間の実演やモーションキャプチャ、高価なペアワイズ選好ラベルに依存せずに、効率的でカスタマイズ可能な行動獲得を実現する。

詳細

LAPPの技術的核心は、LLMを強化学習のフィードバックループに統合し、軌跡レベルの選好予測を行う点にある。従来のアプローチは報酬エンジニアリングや人間の実演、モーションキャプチャ、高価なペアワイズ選好ラベルに依存していたが、LAPPはLLMを活用してこれらのコストを削減する。 評価は、四足歩行と器用な操作タスクの多様なセットで行われ、LAPPは効率的な学習、高い最終性能、速い適応、高レベル行動の精密な制御を達成したと報告されている。特に、LAPPは四足バックフリップのような高度に動的で表現力豊かなタスクをロボットに習得させることができ、これは標準的なLLM生成報酬や手作り報酬では達成が困難であるとされる。

Key Facts

LAPPはLarge Language Model-Assisted Preference Predictionの略で、ロボット学習のための新しいフレームワークである。[1]
LAPPはLLMを強化学習のフィードバックループに統合し、軌跡レベルの選好予測を行う。[1]
LAPPは人間の労力を最小限に抑え、報酬エンジニアリング、人間の実演、モーションキャプチャ、高価なペアワイズ選好ラベルに依存しない。[1]
LAPPは強化学習中に収集された生の状態-行動軌跡からLLMが自動的に選好ラベルを生成する。[1]
LAPPはオンライン選好予測器を訓練し、ポリシー最適化を人間が提供する高レベルの行動仕様に向けて導く。[1]
LAPPは四足歩行と器用な操作タスクの多様なセットで評価された。[1]
LAPPは効率的な学習、高い最終性能、速い適応、高レベル行動の精密な制御を達成したと報告されている。[1]
LAPPは四足バックフリップのような高度に動的で表現力豊かなタスクをロボットに習得させることができる。[1]
四足バックフリップは標準的なLLM生成報酬や手作り報酬では達成が困難であるとされる。[1]
論文はarXivに2025年4月21日付で掲載された(識別番号2504.15472v1)。[1]

なぜ重要か

LAPPは、LLMを利用して選好ラベルを自動生成することで、ロボット学習における人間の介入コストを大幅に削減する可能性を示している。また、従来の報酬設計では困難だった動的で表現力豊かな行動の獲得を可能にし、スケーラブルな選好駆動型ロボット学習の新たな方向性を提示している。