何が起きたか

arXivに2025年5月25日付で掲載された論文「RANDPOL: Parameter-Efficient End-to-End Quadruped Locomotion via Randomized Policy Learning」において、研究者らは四足歩行ロボットのエンドツーエンド制御のための新しいアプローチであるRANDPOLを提案した。この手法は、アクターとクリティックの隠れ層をランダムに初期化して固定し、最終線形層のみを訓練することで、訓練可能なパラメータ数を大幅に削減する。評価はUnitree Go2四足歩行ロボットを用いて行われ、Proximal Policy Optimization (PPO)と比較された。

詳細

従来の学習ベースの歩行コントローラは、多数のパラメータを持つ完全に訓練可能な深層ニューラルネットワークに依存している。RANDPOLは、ランダムな非線形特徴を表現力のある関数クラスとして使用するための数学的基盤であるランダム関数近似に基づいている。この手法により、最適化問題の次元が大幅に削減され、パラメータ効率の高いコントローラクラスが実現される。 実験の結果、RANDPOLはPPOと同等の歩行性能を達成しつつ、訓練可能なパラメータ数がはるかに少なく、学習フェーズの計算時間も1イテレーションあたり短縮され、性能と複雑さのトレードオフが良好であることが示された。さらに、ユーザーが発行する前進速度とヨーレートのコマンドに基づいて、物理的なUnitree Go2へのゼロショットのシミュレーションから実機への転送に成功した。

Key Facts

RANDPOLは、アクターとクリティックの隠れ層をランダムに初期化して固定し、最終線形層のみを訓練する手法である。[1]
RANDPOLはUnitree Go2四足歩行ロボットで評価された。[1]
RANDPOLはProximal Policy Optimization (PPO)と比較された。[1]
RANDPOLはPPOと同等の歩行性能を達成しつつ、訓練可能なパラメータ数がはるかに少ない。[1]
RANDPOLは学習フェーズの計算時間が1イテレーションあたり短縮された。[1]
RANDPOLは物理的なUnitree Go2へのゼロショットのシミュレーションから実機への転送に成功した。[1]
RANDPOLはユーザーが発行する前進速度とヨーレートのコマンドに基づいて動作する。[1]

なぜ重要か

この研究は、構造化されたロボット制御問題において、訓練可能な複雑さを削減しても効果的なシミュレーションおよび実世界の性能を維持できることを示している。これは、計算資源が限られた環境での学習ベース制御の実用性を高める可能性がある。