何が起きたか

研究者らは、VLA基盤モデル「PRTS (Primitive Reasoning and Tasking System)」を発表した。PRTSは、事前学習を教師あり行動クローニングではなく目標条件付き強化学習として定式化し、言語指示を目標として扱う。対比強化学習により、状態行動と目標の埋め込みの内積が対数割引目標占有率を近似する統一埋め込み空間を学習し、報酬注釈なしでオフライン軌跡から密な目標到達可能性の監視を抽出する。

詳細

PRTSは、VLMバックボーンに役割認識因果マスクを介して目標到達可能性の監視を組み込み、バニラ行動クローニングに比べて無視できるオーバーヘッドで済むとしている。167Bトークンの多様な操作および具現化推論データで事前学習され、LIBERO、LIBERO-Pro、LIBERO-Plus、SimplerEnv、および実世界の14の複雑なタスクで最先端の性能に達した。特に、長いホライズン、接触の多い、ゼロショットの新しい指示設定で大きな改善が見られたと報告している。

Key Facts

PRTSは、VLAモデルの事前学習を目標条件付き強化学習として再構築する。[1]
PRTSは、言語指示を目標とみなし、対比強化学習を用いて統一埋め込み空間を学習する。[1]
PRTSは、報酬注釈なしでオフライン軌跡から密な目標到達可能性の監視を抽出する。[1]
PRTSは、167Bトークンの多様な操作および具現化推論データで事前学習された。[1]
PRTSは、LIBERO、LIBERO-Pro、LIBERO-Plus、SimplerEnv、および実世界の14の複雑なタスクで最先端の性能を達成した。[1]

なぜ重要か

PRTSは、VLAモデルの事前学習に強化学習を導入することで、ロボットの目標到達能力を向上させる可能性を示した。これは、単なる行動模倣を超えた、物理的実現可能性を考慮したロボット制御の新たな方向性を提示する。今後のロボット基盤モデルの設計に影響を与えるとともに、実世界での複雑なタスク実行への応用が期待される。