何が起きたか
mingti-orgは、物理AIポリシーのライフサイクル全体(モデル評価、クラウド強化学習ロールアウト、エッジGPU推論、オンボード展開)で使える推論エンジン「PhyAI」を公開した。従来は各設定で別々の推論プログラムが必要だったが、PhyAIは単一ランタイムで、アーキテクチャ固有の条件付け・ソルバー・キャッシュ・出力ロジックをモデルアダプタに分離し、グラフ実行・カーネル・メモリ管理・並列サービスを共有する。VLAモデルと世界行動モデル(WAM)を単一・複数GPUで、オンボード・エッジ・クラウドにわたり実行できる。アダプタインターフェースにより、MiniCPM-Robotはリリース当日に追加された。ベンチマークでは、pi0、pi0.5、GR00T N1.7、MiniCPM-Robotの公式実装に対し1.40〜4.65倍の高速化を達成。Cosmos3-Nano-Policy-DROIDでは、H20 GPU 8基(CFG=2, TP=4)でレイテンシを2.46秒から1.18秒に短縮(2.08倍)。ただし、特定構成では専用ランタイムの方が高速な場合もあり、目標は「単一ランタイムで競争力のあるレイテンシ」としている。また、モデルごとに異なる実行ポリシーが必要な理由を詳細プロファイルで示し、制御時間Rooflineを導入して推論律速か環境律速かを判別する。
Key Facts
| PhyAIは物理AI推論エンジンで、単一ランタイムがアーキテクチャ固有のロジックをモデルアダプタに分離し、グラフ実行・カーネル・メモリ管理・並列サービスを共有する。 | [0] |
| PhyAIはVLAモデルと世界行動モデル(WAM)を、単一または複数GPUでオンボード・エッジ・クラウド展開で実行できる。 | [0] |
| アダプタインターフェースにより、MiniCPM-Robotはリリース当日にPhyAIへ追加された。 | [0] |
| PhyAIはpi0、pi0.5、GR00T N1.7、MiniCPM-Robotの公式実装に対し1.40〜4.65倍の高速化を達成した。 | [0] |
| Cosmos3-Nano-Policy-DROIDでは、H20 GPU 8基(CFG=2, TP=4)でレイテンシを2.46秒から1.18秒に短縮し、2.08倍の高速化となった。 | [0] |
| 特定構成では専用ランタイムの方が高速な場合があり、PhyAIの目標は単一ランタイムで競争力のあるレイテンシを実現することである。 | [0] |
| 詳細プロファイルにより、Hopper世代GPUでバッチサイズ1のとき、pi0.5のアクションエキスパートはFLOPsの8.8%を占めるがレイテンシの57.2%を占めることが示された。 | [0] |
| バッチサイズ32ではpi0.5のアクションエキスパートのレイテンシ割合は13.5%に低下し、スループットは約100サンプル/秒に達する。 | [0] |
| Cosmos3は生成が支配的で、バッチサイズを1から16に増やしてもスループットは14.3%しか向上しない。 | [0] |
| 制御時間Rooflineを導入し、推論律速と環境律速の制御を判別する。測定ではpi0.5の4つのLIBEROスイートは環境律速、Cosmos3は推論律速とされた。 | [0] |
なぜ重要か
物理AIでは、モデル評価、強化学習のロールアウト、エッジ推論、オンボード展開などライフサイクル全体で推論が必要だが、従来は各環境で別々のプログラムが必要だった。PhyAIは単一ランタイムでこれらを統一し、アダプタ方式で新モデルへの迅速な対応を可能にする。さらに、モデルごとに最適な実行ポリシーが異なることを示し、制御時間Rooflineという新たな分析手法を提供することで、物理AIシステムの設計と最適化に重要な知見をもたらす。