何が起きたか
2026年7月22日、arXivに「Evolving Cache Schedules for Fast Diffusion Policy Inference」と題する論文が公開された。提案手法EVOは、拡散ポリシーの反復的デノイジングにおける中間活性の再利用を進化的探索で最適化し、最大8.05倍のアクション生成高速化と、FLOPsを15.77Gから1.96Gまで削減すると報告している。
詳細
EVOは、ブロックとタイムステップの格子全体に対するキャッシュ更新スケジュールを進化的探索で最適化する。冗長性を考慮した初期化と、目標性能に達した時点で探索を終了する早期停止機構を備える。最適化されたスケジュールは、事前学習済みの拡散ポリシーに再学習なしで直接適用できる。ソースコードはGitHubで公開されている。
Key Facts
| EVOは訓練不要の高速化フレームワークで、進化的探索によりキャッシュ更新スケジュールを最適化する。 | [1] |
| 最大8.05倍のアクション生成高速化を達成し、FLOPsを15.77Gから1.96Gに削減する。 | [1] |
| EVOは事前学習済みの拡散ポリシーに再学習なしで直接適用できる。 | [1] |
| ソースコードはhttps://github.com/pillom/EVOで公開されている。 | [1] |
本紙の見方
今回の発表は、拡散ポリシーの実時間展開における計算負荷という実用上の課題に、訓練不要のアプローチで対処する点で新規性がある。既存のキャッシュベース手法はブロック間の冗長性を考慮せず均一に計算を割り当てていたが、EVOは進化的探索によりブロックごとの冗長性に応じたスケジュールを導出する。これにより、性能をほぼ維持しながら計算量を大幅に削減できるとしている。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及は避けるが、ロボット学習分野における推論高速化の流れは、実世界展開への障壁を下げる方向性として注目される。EVOは特定のモデルアーキテクチャに依存せず、事前学習済みモデルに適用可能な点で、汎用性の高い技術とみられる。 業界構造への含意としては、拡散ポリシーを用いたロボット制御の実用化が進む中で、推論コストの削減はエッジデバイスでの展開や応答性向上に寄与する可能性がある。特に、計算資源が限られる環境でのリアルタイム制御が求められる応用において、EVOのような手法は競争力の源泉となり得る。 未確定の論点としては、提案手法の有効性が操作ベンチマークでの評価に基づく点が挙げられる。実環境でのロボット制御における性能や、多様なタスクへの一般化、また進化的探索の計算コスト自体がどの程度であるかは、論文の詳細な検証が必要である。さらに、キャッシュ更新スケジュールの最適化がモデルの性能に与える影響のメカニズムについても、今後の研究が待たれる。
なぜ重要か
拡散ポリシーは高品質な制御を実現する一方で、推論コストが高く実時間展開が課題だった。EVOは訓練不要で既存モデルに適用できるため、ロボット制御の実用化を加速する可能性がある。計算資源の制約が大きい現場での応用が期待される。