日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
制御arXiv:2608.03051v1

CUDA MPC: GPUネイティブなモデル予測制御ソルバー

CUDA MPC: A GPU-Native Solver for Model Predictive Control

シェア:XThreadsFacebookLINEはてブBluesky

モデル予測制御のオンライン最適化をGPU上で完結させるフレームワークを提案し、長い予測ホライズンでもリアルタイム制御を実現した。

詳しい要約

1. どんなもの?

CUDA MPCは、Model Predictive Control (MPC)のためのGPUネイティブなソルバーを提案する。MPCは制約を考慮した制御を提供するが、オンライン最適化に依存するため、高速なダイナミクスや高次元モデル、長いホライズンを持つシステムでの利用が制限される。既存のGPU実装はデバイスを線形代数アクセラレータとして扱い、最適化ループは繰り返しのカーネル起動と高レイテンシのメモリ転送に依存していた。CUDA MPCは、最適化アルゴリズム、実行モデル、メモリ構造をCUDAハードウェア向けに共同設計する。

2. 先行研究と比べてどこがすごい?

先行研究のGPU実装は、デバイスを線形代数アクセラレータとして扱い、最適化ループがカーネル起動とメモリ転送に依存していた。CUDA MPCは、最適化アルゴリズム、実行モデル、メモリ構造をCUDAハードウェア向けに共同設計することで、これらのボトルネックを解消する。具体的には、ホライズン方向に並列なADMM分割と融合カーネルを組み合わせ、デバイス上で反復解法全体を実行する。中間変数をオンチップの共有メモリに保持し、局所的なアトミックフラグプロトコルで隣接ホライズンブロックのみを同期することで、ホスト介入、カーネルディスパッチオーバーヘッド、グローバルメモリトラフィックを最小化する。

3. 技術・手法の肝は?

手法の肝は、MPCの最適化をCUDAハードウェアに合わせて設計することにある。具体的には、ホライズン方向に並列なADMM分割を採用し、融合CUDAカーネルでデバイス上で全体の反復解法を実行する。中間最適化変数は低レイテンシのオンチップ共有メモリに保持され、局所的なアトミックフラグプロトコルで隣接ホライズンブロックのみを同期する。これにより、ホスト介入、カーネルディスパッチオーバーヘッド、グローバルメモリトラフィックを最小化する。

4. どうやって有効だと検証した?

6つの非線形ロボティクスベンチマーク(状態次元と制約密度が増加)で評価した。CPUソルバーよりも1〜2桁長いホライズンでリアルタイムレートを維持し、衝突回避駐車問題(100秒のルックアヘッド)を0.1秒のサンプリング間隔で解いた。また、集中型10エージェント群れでは、acadosとCasADiが実行可能解を返さず、1回のソルブに3.5秒と4.5秒かかるのに対し、CUDA MPCだけがリアルタイム実行と衝突回避の調整を達成した。さらに、同じADMM分割のテンソルフレームワーク実装と比較して、融合カーネルは最大965倍高速である。

5. 議論はある?

要旨からは、CUDA MPCの有効性は示されているが、限界や議論については不明。例えば、GPUメモリ容量やスケーラビリティ、他のプラットフォームへの移植性、収束保証などは言及されていない。また、ベンチマークが非線形ロボティクスに限定されており、他の分野での性能は不明。

6. 次に読むべき論文は?

要旨で参照されているのは、acadosとCasADi(比較対象のソルバー)と、テンソルフレームワーク実装(比較対象)である。また、ADMM(Alternating Direction Method of Multipliers)が手法として用いられている。次に読むべき論文としては、acadosやCasADiの詳細、またはADMMの理論的基盤に関する論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Babak Akbari, Melissa Greeff

分類: cs.RO, cs.DC, eess.SY

原文アブストラクト

Model Predictive Control (MPC) delivers constraint-aware control, but its reliance on online optimization limits its use on systems with fast dynamics, high-dimensional models, or long horizons. Existing GPU implementations typically treat the device as a linear-algebra accelerator, leaving the optimization loop dependent on repeated kernel launches and high-latency memory transfers. This paper introduces CUDA MPC, a GPU-native MPC framework that co-designs the optimization algorithm, execution model, and memory architecture for CUDA hardware. CUDA MPC pairs a parallel-in-horizon alternating direction method of multipliers (ADMM) splitting with a fused CUDA kernel that runs the entire iterative solve on the device. Intermediate optimization variables stay in low-latency, on-chip shared memory, and a localized atomic-flag protocol synchronizes only adjacent horizon blocks, minimizing host intervention, kernel-dispatch overhead, and global-memory traffic. Across six nonlinear robotics benchmarks spanning increasing state dimension and constraint density, CUDA MPC sustains real-time rates at horizons one to two orders of magnitude longer than CPU solvers: it solves an optimization-based collision-avoidance parking problem with 100 s of lookahead within a 0.1 s sampling interval, and is the only solver evaluated that achieves both real-time execution and collision-free coordination for a centralized 10-agent swarm, where acados and CasADi return no feasible solution and require 3.5 s and 4.5 s per solve. Against tensor-framework implementations of the same ADMM splitting, the fused kernel is up to $965\times$ faster.