何が起きたか
2026年5月19日、arXivに投稿された論文『ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders』で、ゲーム『ARC Raiders』のクリーチャーに着想を得た4種のロボット形態(18-DoFのQueen、12-DoFのBastion、18-DoFのTick、12-DoFのLeaper)を含むMuJoCo連続制御環境群が発表された。
詳細
ARC-RLは、4つのMuJoCo連続制御環境から成り、各環境はゲーム『ARC Raiders』のクリーチャーに着想を得たロボット形態を持つ。Queenは18自由度の背の高い六脚、Bastionは12自由度の装甲六脚、Tickは18自由度のコンパクトな六脚、Leaperは12自由度の四脚。全ロボットは統一された観測テンプレート、行動規約、シミュレーション周期、単一の閉形式多成分報酬関数を共有し、形態ごとの差異は少数の重みとパラメータのみ。報酬は速度追従、生存ボーナス、位相ロック歩容コンプライアンス、行動正則化、3つの安全ペナルティ、姿勢アンカーで構成され、モーションキャプチャデータは報酬に一切使用されない。また、各形態に対して手作りのCentral Pattern Generatorデモンストレータが提供され、オフラインからオンラインへの学習の事前データとして利用可能。
Key Facts
| ARC-RLは4つのMuJoCo連続制御環境を提供し、各環境はゲーム『ARC Raiders』のクリーチャーに着想を得たロボット形態を持つ(Queen: 18-DoF、Bastion: 12-DoF、Tick: 18-DoF、Leaper: 12-DoF)。 | [1] |
| 全ロボットは統一された観測テンプレート、行動規約、シミュレーション周期、単一の閉形式多成分報酬関数を共有し、形態ごとの差異は少数の重みとパラメータのみ。 | [1] |
| 報酬関数は速度追従、生存ボーナス、位相ロック歩容コンプライアンス、行動正則化、3つの安全ペナルティ、姿勢アンカーで構成され、モーションキャプチャデータは報酬に一切使用されない。 | [1] |
| 各形態に対して手作りのCentral Pattern Generatorデモンストレータが提供され、固定の専門家参照とオフラインからオンラインへの学習の事前データとして機能する。 | [1] |
| ソースコードはhttps://github.com/CarloRomeo427/ARC_RL.gitで公開されている。 | [1] |
なぜ重要か
ARC-RLは、強化学習ベンチマークの形態を実機ロボットからゲーム的なクリーチャーへ拡張することで、ロコモーション研究の適用範囲を広げる可能性がある。報酬設計の統一性とモーションキャプチャ非依存のアプローチは、再現性の高い比較研究を促進し、スタイル制約下での学習アルゴリズムの頑健性評価に寄与するだろう。