何が起きたか

研究者らは、VLA基盤モデル「PRTS (Primitive Reasoning and Tasking System)」を発表した。PRTSは、事前学習を教師あり行動クローニングではなく目標条件付き強化学習として定式化し、言語指示を目標として扱う。対比強化学習により、状態行動と目標の埋め込みの内積が対数割引目標占有率を近似する統一埋め込み空間を学習し、報酬注釈なしでオフライン軌跡から密な目標到達可能性の監視を抽出する。

詳細

PRTSは、VLMバックボーンに役割認識因果マスクを介して目標到達可能性の監視を組み込み、バニラ行動クローニングに比べて無視できるオーバーヘッドで済むとしている。167Bトークンの多様な操作および具現化推論データで事前学習され、LIBERO、LIBERO-Pro、LIBERO-Plus、SimplerEnv、および実世界の14の複雑なタスクで最先端の性能に達した。特に、長いホライズン、接触の多い、ゼロショットの新しい指示設定で大きな改善が見られたと報告している。

Key Facts

PRTSは、VLAモデルの事前学習を目標条件付き強化学習として再構築する。出典一覧
PRTSは、言語指示を目標とみなし、対比強化学習を用いて統一埋め込み空間を学習する。出典一覧
PRTSは、報酬注釈なしでオフライン軌跡から密な目標到達可能性の監視を抽出する。出典一覧
PRTSは、167Bトークンの多様な操作および具現化推論データで事前学習された。出典一覧
PRTSは、LIBERO、LIBERO-Pro、LIBERO-Plus、SimplerEnv、および実世界の14の複雑なタスクで最先端の性能を達成した。出典一覧

本紙の見方

今回の発表は、VLAモデルの事前学習パラダイムに対する根本的な再考を示す。従来のVLAは教師あり行動クローニングとして事前学習されることが多く、ロボット学習の本質である目標到達プロセスの時間的進展を捉えられていなかった。PRTSは、目標条件付き強化学習を導入することで、言語指示を目標として扱い、状態行動と目標の埋め込みの内積が対数割引目標占有率を近似するように学習する。これにより、静的な意味的マッチングを超えた物理的実現可能性の定量的評価が可能になる。 本紙の過去報道との接続はないが、このアプローチは、ロボット基盤モデルにおける強化学習の役割を再評価する流れの一部とみられる。特に、報酬注釈なしでオフライン軌跡から密な監視を抽出する点は、データ効率の向上に寄与する可能性がある。 業界構造への含意として、VLAモデルの性能向上は、ロボットの汎用性と長期的な計画能力に影響を与える。特に、長いホライズンや接触の多いタスクでの改善は、実世界の複雑な操作への応用を後押しする。ただし、PRTSの性能はシミュレーションと実世界の限定的なタスクで評価されており、大規模な実世界展開にはさらなる検証が必要である。 未確定の論点としては、PRTSのスケーラビリティ、異なるロボットプラットフォームへの一般化、学習データの多様性が挙げられる。また、目標到達可能性の監視が具体的にどのように行動予測に影響するか、そのメカニズムの詳細も今後の研究課題となる。

なぜ重要か

PRTSは、VLAモデルの事前学習に強化学習を導入することで、ロボットの目標到達能力を向上させる可能性を示した。これは、単なる行動模倣を超えた、物理的実現可能性を考慮したロボット制御の新たな方向性を提示する。今後のロボット基盤モデルの設計に影響を与えるとともに、実世界での複雑なタスク実行への応用が期待される。