日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習/UAVarXiv:2608.14135v1

AgilePE: 自己対戦強化学習による自律UAV追跡・回避

AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

自己対戦強化学習を用いて、UAVの追跡・回避行動をエンドツーエンドで学習し、シミュレーションから実機へのゼロショット転送を実現したシステムを提案する。

詳しい要約

1. どんなもの?

AgilePEは、UAVの追跡・逃避(pursuit-evasion)タスクを自己対戦強化学習(self-play reinforcement learning)で解くための完全なシステムである。エージェントは機体の状態観測を直接、Collective Thrust and Body Rates (CTBR)コマンドにマッピングするエンドツーエンドのポリシーを持ち、中間の軌道プランナーやウェイポイントコントローラを介さずにアジャイルな機動を実現する。トレーニングにはPrioritized Fictitious Self-Play (PFSP)と多様な対戦相手プールを用い、シミュレーションから実機への転移(sim-to-real)を考慮したパイプラインを備える。実機ではゼロショットでタスクを実行できる。

2. 先行研究と比べてどこがすごい?

従来のルールベースや微分ゲーム(differential game)アプローチは、高次元の空中インタラクションやアジャイルな機動に苦労していた。AgilePEは、自己対戦強化学習を導入することで、複雑な追跡・逃避戦略(例えば、急速な回避や側面攻撃)を自動的に獲得できる点が優れている。また、ハードウェアに合わせたシミュレーションパイプラインにより、実機へのゼロショット転移を可能にし、タスク固有のチューニングを不要にしている点も新しい。

3. 技術・手法の肝は?

手法の肝は、以下の3点である。(1) エンドツーエンドのポリシー:状態観測からCTBRコマンドを直接出力し、アジャイルな機動を可能にする。(2) 競争的自己対戦:PFSPと多様な対戦相手プールを用いることで、過去のポリシーに対して改善しつつ、最適化の安定化とポリシーの振動低減を図る。(3) ハードウェア整合シミュレーション:アクチュエータ応答ダイナミクス、通信遅延、ドメインランダマイゼーションをモデル化し、実機への転移を容易にする。

4. どうやって有効だと検証した?

有効性は、実機のクアッドローターを用いた実験で検証された。シミュレーションで観察された追跡・逃避戦術(急速な回避や側面攻撃)が実機でも再現され、2エージェントのインタラクティブなゼロショット展開が実証された。具体的な数値指標は要旨からは不明である。

5. 議論はある?

要旨からは、議論の余地として、自己対戦強化学習におけるポリシーの振動や最適化の不安定性への対処が挙げられるが、PFSPと対戦相手プールにより緩和されている。また、シミュレーションと実機のギャップ(sim-to-real gap)について、ハードウェア整合パイプラインで対処しているが、完全に解消されているかは不明。さらに、2エージェントのインタラクションに焦点を当てており、多エージェントや異種エージェントへの拡張性は議論されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Prioritized Fictitious Self-Play (PFSP)の元となったFictitious Self-Play (FSP)や、自己対戦強化学習の一般的な手法(例えば、AlphaGoやOpenAI Fiveなど)が挙げられる。また、sim-to-real転移の関連では、ドメインランダマイゼーションを用いた研究(例えば、Tobin et al.のDomain Randomization)や、UAVのアジャイル制御に関する研究(例えば、Neural-SwarmやAgile Autonomy)が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Wenhao Tang, Tianyang Chen, Zhejun Cui, Boyuan An, Jiayu Chen, Ruize Zhang, Huidong Liu, Tianyue Wu, Qingmin Liao, Fei Gao, Yu Wang, Chao Yu

分類: cs.RO, cs.LG

原文アブストラクト

Autonomous pursuit-evasion is a fundamental challenge for Unmanned Aerial Vehicles (UAVs), requiring rapid decision-making under tightly coupled dynamics and continuously changing opponent behaviors. Traditional rule-based or differential-game approaches often struggle with high-dimensional aerial interactions and agile maneuvering. We present AgilePE, a complete system for autonomous UAV pursuit-evasion via self-play reinforcement learning. AgilePE integrates agile low-level control, competitive policy optimization, and sim-to-real deployment in a unified framework. The policy directly maps onboard state observations to Collective Thrust and Body Rates (CTBR) commands, enabling end-to-end agile maneuvering without intermediate trajectory planners or waypoint controllers. For training, we use competitive self-play with Prioritized Fictitious Self-Play (PFSP) and a diversified opponent pool, enabling agents to improve against historical policies while stabilizing optimization and reducing policy oscillation. This process leads to the emergence of sophisticated pursuit and evasion strategies. For real-world deployment, we develop a hardware-aligned simulation pipeline that models actuator-response dynamics, communication latency, and domain randomization. The learned policies transfer zero-shot to real quadrotors without task-specific tuning. Real-world experiments reproduce pursuit-evasion tactics observed in simulation, including rapid dodging and flanking, and demonstrate interactive two-agent zero-shot deployment.