日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
sim2realarXiv:2609.09492

脚式ロボット学習における狭可生存性タスクのためのアクチュエータダイナミクスカリキュラム

Actuator Dynamics Curricula for Narrow-Viability Tasks in Legged Robot Learning

シェア:XThreadsFacebookLINEはてブBluesky

関節剛性を高く初期化し、エピソード完了長に応じて同定値まで徐々に下げるカリキュラムを提案し、Spotの四足から逆立ちへの遷移など探索が終了条件で妨げられるタスクの学習を可能にした。

詳しい要約

1. どんなもの?

- 脚式ロボットの強化学習において、標準的な訓練では収束しないタスク(探索の多くが早期終了し、有用な勾配信号が得られない)を対象とする。 - アクチュエータダイナミクスカリキュラムを提案。関節剛性を高い値で初期化し、完了エピソード長の増加に伴いシステム同定値に向けてアニーリングする。 - cart-poleを代表例とし、臨界減衰下での高い閉ループ関節固有振動数がMDPのviability kernelを拡大し、タスクが実行可能な初期状態の割合を増やすことを示す。 - Boston Dynamics Spotの四脚からハンドスタンドへの遷移(narrow-viabilityタスク)に適用し、固定剛性では遷移を完了しないポリシーが訓練されるが、カリキュラムによりシミュレーションで10シード全てで遷移を実行し、ハードウェアに転移した。

2. 先行研究と比べてどこがすごい?

- 従来の強化学習は多くの脚式ロボットタスクで有能なコントローラを生成するが、一部のタスクでは標準訓練で収束しない。 - 提案手法は、アクチュエータダイナミクスをカリキュラムの軸として利用することで、報酬信号ではなく終了条件によって探索がボトルネックとなるタスクに対処する点が新しい。 - 固定同定剛性下では訓練がプラトーに達し遷移を完了できないのに対し、カリキュラム適用によりシミュレーションで成功しハードウェア転移も達成。

3. 技術・手法の肝は?

- アクチュエータダイナミクスカリキュラム:関節剛性を高い値で初期化し、完了エピソード長の増加に応じてシステム同定値へアニーリング。 - 臨界減衰下で高い閉ループ関節固有振動数がMDPのviability kernelを拡大し、初期状態の実行可能割合を増加させる。 - cart-poleでviability kernelの単調性を検証し、その原理を四脚ロボットのハンドスタンド遷移に適用。

4. どうやって有効だと検証した?

- cart-poleシステムでviability kernelの単調性を検証。 - Boston Dynamics Spotの四脚からハンドスタンドへの遷移タスクにカリキュラムを適用し、シミュレーションで10シード全てで遷移を実行。 - 訓練されたポリシーがハードウェアに転移することを確認。

5. 議論はある?

- シミュレーションされたアクチュエータダイナミクスが、報酬信号ではなく終了条件によって探索がボトルネックとなるタスクのカリキュラム設計に有用な軸であることを示唆。 - 具体的な限界や議論の詳細は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:標準的な強化学習、システム同定、viability kernel、cart-pole、Boston Dynamics Spot。 - 関連手法:カリキュラム学習、ドメインランダム化、アクチュエータダイナミクスモデリング。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kousheek Chakraborty, Chandan K. Rajendra, Ayham Alharbat, Abeje Y. Mersha

分類: cs.RO

原文アブストラクト

Reinforcement learning has produced capable controllers across a broad range of legged-robot tasks, but a subset of these tasks fail to converge under standard training: those for which most exploration trajectories terminate before producing useful gradient signal. To address such tasks we introduce the \emph{Actuator Dynamics Curriculum}, a procedure that initializes joint stiffness at a high value and anneals it toward the system-identified value as completed episode lengths grow. Using a cart-pole system as a representative example, we show that higher closed-loop joint natural frequency under critical damping enlarges the viability kernel of the underlying Markov Decision Process, increasing the fraction of initial states from which the task is feasible. We validate the kernel monotonicity on the cart-pole and apply the curriculum to a quadrupedal-to-handstand transition on the Boston Dynamics Spot, a narrow-viability task where training under fixed identified stiffness plateaus at a policy that never completes the transition. The trained policy executes the transition in simulation across 10 seeds and transfers to hardware. More broadly, our results suggest that simulated actuator dynamics is a useful axis along which to design curricula for tasks in which exploration is bottlenecked by termination conditions rather than by reward signal.

関連論文