何が起きたか

強化学習による長期的操作スキルの学習は、報酬設計の複雑さ、疎な報酬の限定的なガイダンス、手動サブタスク注釈の高コストにより困難である。視覚デモは報酬学習の監督を提供できるが、生のピクセルから学習された報酬は視覚的変化、背景の外観、ロボットの動きに敏感で脆い。この研究では、行動なしのビデオデモから密な報酬を学習するGORDONを提案する。各視覚シーンは検出されたオブジェクトと空間関係のグラフとして表現され、グラフニューラルネットワークが自己教師ありでタスク整合的な潜在空間に埋め込む。活動認識加重プーリング機構により、タスク関連オブジェクトを強調し、ロボット支配の動きをマスクする。密な報酬は、現在の状態の潜在空間におけるデモの目標構成への距離として計算される。長期的タスクでは、報酬の時間プロファイルが段階的なオブジェクト状態遷移を明らかにし、手動セグメンテーションなしで自動サブタスク発見を可能にする。発見されたセグメントはサブタスク固有の報酬と専門ポリシーの訓練に使用され、順次構成される。MAGICALとManiSkill3ベンチマークの7つの操作タスクでの実験により、物体中心報酬が短期的設定での強化学習を改善し、自動分解を通じて複雑な長期的タスクでのポリシー学習を成功させ、長期的タスク全体で平均成功率74.4%を達成した(平均で最良の学習ベースラインより約+35パーセントポイント、オラクルより約+25パーセントポイント)。

Key Facts

GORDONは、行動なしのビデオデモから密な報酬を学習するグラフベースの物体中心報酬学習フレームワークである。[0]
各視覚シーンは検出されたオブジェクトと空間関係のグラフとして表現され、グラフニューラルネットワークが自己教師ありでタスク整合的な潜在空間に埋め込む。[0]
活動認識加重プーリング機構により、タスク関連オブジェクトを強調し、ロボット支配の動きをマスクする。[0]
密な報酬は、現在の状態の潜在空間におけるデモの目標構成への距離として計算される。[0]
長期的タスクでは、報酬の時間プロファイルが段階的なオブジェクト状態遷移を明らかにし、手動セグメンテーションなしで自動サブタスク発見を可能にする。[0]
発見されたセグメントはサブタスク固有の報酬と専門ポリシーの訓練に使用され、順次構成される。[0]
MAGICALとManiSkill3ベンチマークの7つの操作タスクでの実験により、物体中心報酬が短期的設定での強化学習を改善し、自動分解を通じて複雑な長期的タスクでのポリシー学習を成功させた。[0]
長期的タスク全体で平均成功率74.4%を達成した(平均で最良の学習ベースラインより約+35パーセントポイント、オラクルより約+25パーセントポイント)。[0]

なぜ重要か

この研究は、長期的な操作タスクにおける強化学習の課題に対処する新しいフレームワークを提案している。物体中心の表現と自動サブタスク発見により、手動注釈のコストを削減し、複雑なタスクでの学習を可能にする可能性がある。