何が起きたか
arXiv掲載の論文「DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation」は、巧緻把持の強化学習において、訓練の進行に応じて探索幅を広くから狭くへ段階的に変える方針を提案した。論文は、PPO、critic-free GRPO continuation、flow-parameterized PPO variant(FPO)の3つの方策最適化設定を比較し、YCBオブジェクト5種・訓練シード3本で評価した。さらに、RealMan RM75アームとInspire/RH56ハンドを用いた360試行・3物体の実機評価も示した。
詳細
論文では、探索の強さを訓練ステップの関数として明示的に設定し、損失関数、アーキテクチャ、報酬、最適化器は固定したまま比較した。対象は、PPO、critic-free GRPO continuation、FPOの3設定である。 報告された平均deterministic Target successは、YCBの5物体・3シードで、FPOが49.4%から68.1%、GRPOが14.1%から45.4%、PPOが32.0%から35.7%へ上昇した。実機のRealMan RM75アームとInspire/RH56ハンドでは、3物体・360試行で、FPOが25.0%から85.0%、GRPOが10.0%から63.3%、PPOが8.3%から43.3%へ改善した。PPOの構成要素比較では、試した最適化器の収縮よりノイズ制御が有利とされ、選択されたPPOスケジュールは同じ終端値を持つ線形減衰より高い平均Target successを示したとされる。
Key Facts
| DexPolicyは、訓練ステップに応じて探索幅を広から狭へ調整する方針を提案した。 | [1] |
| 比較対象はPPO、critic-free GRPO continuation、flow-parameterized PPO variant(FPO)の3設定である。 | [1] |
| YCBオブジェクト5種・訓練シード3本で、平均deterministic Target successはFPO 49.4%→68.1%、GRPO 14.1%→45.4%、PPO 32.0%→35.7%だった。 | [1] |
| RealMan RM75アームとInspire/RH56ハンドを使った360試行・3物体の実機評価で、平均Target successはFPO 25.0%→85.0%、GRPO 10.0%→63.3%、PPO 8.3%→43.3%だった。 | [1] |
| コードはhttps://github.com/AIGeeksGroup/DexPolicy、ウェブサイトはhttps://aigeeksgroup.github.io/DexPolicy とされた。 | [1] |
本紙の見方
DexPolicyの新規性は、巧緻把持における探索を「多めに試すか、絞って詰めるか」という経験則ではなく、訓練ステップの関数として明示的に扱った点にある。既存のPPO系学習でも探索は暗黙に効いているが、この論文は損失、アーキテクチャ、報酬、オプティマイザを固定し、探索スケジュールだけを前面に出して比較しているため、性能差の解釈が比較的はっきりしている。YCB 5物体と実機360試行の両方で、FPOとGRPOの改善幅がPPOを上回っており、少なくともこの設定では「学習を進めるほど探索を狭める」設計が有効だったと読める。 本紙の過去報道との接続はないが、今回の論文はtrajectory-guided settings、すなわち人間動画から手先・物体の軌道を学び、その後にRLで詰める流れを前提にしている。ここで重要なのは、学習時のreturnやdeterministic Target successが、そのまま実機での耐雑音性を保証しないと論文が述べている点である。つまり、シミュレーション上の学習指標よりも、最終的に実行条件下でどの程度ターゲット成功率を出せるかが評価軸になる。これは、デモ模倣とRLの組み合わせを採るロボット操作で、どの段階で探索を絞るかが性能を左右することを示唆する。 業界構造への含意としては、アルゴリズム単体の改善であっても、実機評価がRealMan RM75アームとInspire/RH56ハンドという具体的な構成で示されているため、制御方式とハードウェアの組み合わせで結果が変わる可能性が高い。加えて、FPO・GRPO・PPOという3系統を同一条件で並べたことで、今後は「どの手法が強いか」よりも「どの探索スケジュールがその手法に合うか」が比較の焦点になりやすい。まだ分からないのは、対象物がYCB 5種と3物体に限られる中で、より複雑な把持、異なる手先、異なる実行ノイズ条件でも同じ傾向が維持されるかどうかである。コード公開はあるが、学習に使ったデータの範囲、各物体ごとの個別設定、収束までの計算量は本文要約からは読み切れない。
なぜ重要か
論文が示したのは、探索の設計を変えるだけでも、YCB 5種や実機360試行の範囲でTarget successが大きく変わりうるという点である。巧緻把持の学習では、学習中の指標だけでなく、実際の実行条件で成功率をどう確保するかが課題になるため、探索スケジュールを明示的に扱う意義は大きいとみられる。