日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
sim2realarXiv:2609.24054

AquaOrbit: 断続的な視覚フィードバック下での水中ターゲット周回のためのSim-to-Real強化学習

AquaOrbit: Sim-to-Real Reinforcement Learning for Underwater Target Orbiting under Intermittent Visual Feedback

シェア:XThreadsFacebookLINEはてブBluesky

視覚が途切れる水中環境で、目標を見失っても復帰モジュールで安定化・再捕捉しながら周回する強化学習制御器を開発し、シミュレーションから実機へゼロショット転移させた。

詳しい要約

1. どんなもの?

- 水中で移動するターゲットを周回するタスクにおいて、視覚フィードバックが断続的に失われる状況に対応する強化学習コントローラ「AquaOrbit」を提案。 - 検出喪失時に復帰モジュールがラッチしたline-of-sight、roll、depth参照を用いて安定化とターゲット再捕捉を支援。 - Isaac Simで動力学・観測・視覚喪失のランダム化を行い訓練し、Gazebo/ROS2で再訓練なしに評価。 - 静的・動的ターゲット条件で20/20の周回試行を完了し、動的ターゲットではPIDベースのvisual servoingと比べ平均line-of-sight誤差を約46%低減。 - 実機ゼロショット展開で楕円、8の字、可変深度円軌道を実現し、手動オクルージョンや視野喪失からの再捕捉も確認。

2. 先行研究と比べてどこがすごい?

- 従来のPIDベースvisual servoingコントローラ(復帰機能付き)と比較して、動的ターゲット条件で平均line-of-sight誤差を約46%低減。 - 復帰モジュールを除去すると完了試行が9/20に減少し、その有効性を定量的に示す。 - 異なる物理エンジンと知覚摂動下で再訓練なしに評価され、sim-to-realギャップへの頑健性を示す。 - 訓練にない軌道タイプ(8の字、可変深度円)を含むゼロショット実機展開を達成。 - 手動オクルージョン最大8秒間の姿勢安定性維持と、視野喪失イベントでの2.5秒以内の再捕捉を報告。

3. 技術・手法の肝は?

- 強化学習コントローラに復帰モジュールを組み込み、視覚検出喪失時にラッチしたline-of-sight、roll、depth参照を利用。 - 訓練はIsaac Simで行い、動力学、観測、視覚喪失のランダム化を実施。 - 復帰モジュールは安定化とターゲット再捕捉を支援する役割を担う。 - 評価はGazebo/ROS2で異なる物理エンジンと知覚摂動下で実施。 - 実機展開では完全オンボードの知覚と制御を使用。

4. どうやって有効だと検証した?

- Gazebo/ROS2で再訓練なしに静的・動的ターゲット条件で各20/20の周回試行を完了。 - 動的ターゲット条件でPIDベースvisual servoingと比較し、平均line-of-sight誤差を約46%低減。 - 復帰モジュール除去時は完了が9/20に減少することを確認。 - 実機ゼロショット展開で楕円、8の字、可変深度円軌道を実現。 - 手動オクルージョン最大8秒間の姿勢安定性維持と、視野喪失イベントでの2.5秒以内の再捕捉を報告。

5. 議論はある?

- 要旨からは、提案手法の限界や失敗事例、計算コスト、一般化可能性に関する議論は明示されていない。 - 復帰モジュールの有無による性能差や、異なる物理エンジン下での評価結果は示されているが、詳細な議論は要旨からは不明。 - 実機展開でのオクルージョンや視野喪失への対応は報告されているが、他の外乱や環境条件への影響は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照されているPID-based visual servoing controller with recovery。 - 同分野の関連手法として、sim-to-real強化学習、underwater visual servoing、target tracking、domain randomization、recovery moduleに関する研究が挙げられる。 - 具体的な論文名は要旨に記載がないため、上記の一般名で関連研究を探索することが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kanzhong Yao, Jinyi Leng, Hao Zhang, Zhe Sun, Xuelong Li

分類: cs.RO

原文アブストラクト

Intermittent visual loss disrupts target-relative feedback during underwater orbiting, making it difficult to maintain coordinated motion and reacquire a moving target. We present AquaOrbit, a reinforcement-learning controller with a recovery module for underwater target orbiting under interrupted visual feedback. During detection loss, the recovery module uses latched line-of-sight, roll, and depth references to support stabilization and target reacquisition. We train the controller in Isaac Sim with dynamics, observation, and vision-loss randomization. Evaluated without retraining in Gazebo/ROS2 under a different physics engine and perception perturbations, AquaOrbit completes 20/20 orbiting trials in each of the static- and moving-target conditions on an unseen variable-depth 3-D trajectory. In the moving-target condition, it reduces mean line-of-sight error by approximately 46% relative to a PID-based visual servoing controller with recovery while maintaining comparable path-tracking accuracy; removing the recovery module reduces completion to 9/20. Zero-shot physical deployment with fully onboard perception and control demonstrates elliptical, figure-eight, and variable-depth circular trajectories, including the latter two trajectory types absent from training. The robot maintains attitude stability during manual occlusions lasting up to 8s and reacquires the target within 2.5s in the reported attitude-induced field-of-view loss events.

関連論文

PR本紙発行元 EmplifAI