日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
安全制御/到達可能性解析arXiv:2609.14087

勾配不要のニューラルHamilton-Jacobi到達可能性によるスケーラブルな安全臨界制御

Gradient-Free Neural Hamilton-Jacobi Reachability for Scalable Safety-Critical Control

シェア:XThreadsFacebookLINEはてブBluesky

制御・外乱アフィン系に対し、勾配を使わずにBellman-Isaacs値伝播で後方到達可能チューブを学習するニューラル到達可能性フレームワークを提案し、最大80次元で安定かつ高精度な安全制御を実現した。

詳しい要約

1. どんなもの?

- 高次元非線形システムの安全保証とロバスト制御のためのHamilton-Jacobi (HJ) reachability解析を、勾配不要でスケーラブルに学習するフレームワーク。 - control-disturbance-affine系を対象に、離散時間でbackward reachable tubes (BRTs)とbackward reach-avoid tubes (BRATs)をBellman-Isaacs値伝播により学習。 - 最大80次元のベンチマーク問題と、16,000次元超のegocentric入力を用いたF1-tenth racingで観測空間スケーラビリティを実証。 - 学習した安全フィルタは未見トラックへのzero-shot汎化と実機RCカーへの転移を達成し、リアルタイム衝突回避を実現。

2. 先行研究と比べてどこがすごい?

- 従来のgrid-basedソルバは次元の呪い、continuous-time neuralソルバは正確な空間値勾配を要求、reinforcement-learningベースは境界アンカリングが弱く非定常な敵対ポリシー最適化に悩む。 - 提案法はPDE勾配を明示的に計算せず、bang-bang構造を利用した勾配不要の値プローブから近似教師行動を構築し、敵対的actor学習を教師ありポリシー学習に変換。 - これにより既存の学習ベースソルバより安定性を改善しつつ、高次元問題でも正確なreachability値関数を学習可能。

3. 技術・手法の肝は?

- 離散時間のBellman-Isaacs値伝播に基づき、equation-driven自己教師あり学習と構造化ポリシー学習を組み合わせる。 - 最適安全介入のbang-bang構造を活用し、勾配不要の値プローブから近似教師行動を生成、敵対的actor学習を教師あり学習に置き換える。 - 長ホライズン値伝播の安定化のため、学習したactorを用いてterminal boundaryから後方に値関数を訓練するwindowed temporal curriculumを採用。各ウィンドウを次のウィンドウの境界条件として使用。

4. どうやって有効だと検証した?

- 最大80次元のベンチマーク問題で、正確なreachability値関数を学習しつつ既存の学習ベースソルバより安定性が向上することを確認。 - F1-tenth racingにおいて16,000次元超のegocentric入力に対する観測空間スケーラビリティを実証。 - 学習した安全フィルタが未見トラックへzero-shot汎化し、実機RCカーに転移してリアルタイムロバスト衝突回避を達成。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:classical grid-based solvers、continuous-time neural solvers、reinforcement-learning-based approaches。 - 関連手法:Hamilton-Jacobi (HJ) reachability、backward reachable tubes (BRTs)、backward reach-avoid tubes (BRATs)、Bellman-Isaacs値伝播、bang-bang制御、windowed temporal curriculum。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zeyuan Feng, Ali Fuat Sahin, Santiago Thorup, Somil Bansal

分類: cs.RO, eess.SY

原文アブストラクト

Hamilton-Jacobi (HJ) reachability provides a principled framework for synthesizing safety certificates and robust controllers for safety-critical robotic systems. However, applying reachability analysis to high-dimensional nonlinear systems remains challenging: classical grid-based solvers suffer from the curse of dimensionality, continuous-time neural solvers require accurate spatial value gradients, and reinforcement-learning-based approaches often suffer from weak boundary anchoring and non-stationary adversarial policy optimization. We propose a discrete-time neural reachability framework for control-disturbance-affine systems that learns backward reachable tubes (BRTs) and backward reach-avoid tubes (BRATs) through Bellman-Isaacs value propagation. Our key idea is to combine equation-driven self-supervision with structured policy learning: rather than computing explicit PDE-gradients, we exploit the bang-bang structure of optimal safety interventions to construct approximate teacher actions from gradient-free value probes, converting adversarial actor learning into supervised policy learning. To stabilize long-horizon value propagation, we leverage the learned actor to train the value function backward from the terminal boundary using a windowed temporal curriculum, where each window is used as the boundary condition for the next window. Across benchmark problems up to 80 dimensions, our method learns accurate reachability value functions while improving stability over existing learning-based solvers. We further demonstrate observation-space scalability on F1-tenth racing with over 16,000-dimensional egocentric inputs. The learned safety filter generalizes zero-shot to unseen tracks and transfers to a physical RC car, achieving real-time robust collision avoidance.

関連論文