何が起きたか
研究チームは、オンデバイスLLMのハードウェア協調設計のためのスケーリング則を提案した。この手法は、アーキテクチャのハイパーパラメータの関数として訓練損失をモデル化し、ローフライン・モデルで推論遅延を特性化する。NVIDIA Jetson Orin上で1,942の候補アーキテクチャを評価し、170のモデルを各10Bトークンで訓練してスケーリング則を適合させた。
詳細
研究チームは、ハードウェア協調設計則を提案し、モデル精度と推論性能を同時に捉える。訓練損失をアーキテクチャのハイパーパラメータの明示的な関数としてモデル化し、推論遅延をローフライン・モデルで特性化する。NVIDIA Jetson Orin上で1,942の候補アーキテクチャを評価し、170の選択モデルを各10Bトークンで訓練して、アーキテクチャと訓練損失を関連付けるスケーリング則を適合させた。このスケーリング則と遅延モデルを結合することで、精度と遅延の直接的な対応関係を確立し、ハードウェア協調設計されたLLMのパレート最前線を特定する。さらに、アーキテクチャ探索を精度と性能の同時最適化として定式化し、産業用ハードウェアとアプリケーションの予算の下で実現可能な設計領域を導出する。このアプローチにより、アーキテクチャ選択の期間を数か月から数日に短縮できるとしている。ターゲットハードウェア上でQwen2.5-0.5Bと同じ遅延で、協調設計されたアーキテクチャはWikiText-2で19.42%低いパープレキシティを達成した。研究チームは、オンデバイスLLM展開におけるハードウェア協調設計スケーリング則の最初の原理的かつ実用的なフレームワークであるとしている。コードと関連チェックポイントは公開予定。
Key Facts
| 研究チームは、ハードウェア協調設計則を提案し、モデル精度と推論性能を同時に捉える。 | [1] |
| NVIDIA Jetson Orin上で1,942の候補アーキテクチャを評価し、170のモデルを各10Bトークンで訓練した。 | [1] |
| Qwen2.5-0.5Bと同じ遅延で、協調設計されたアーキテクチャはWikiText-2で19.42%低いパープレキシティを達成した。 | [1] |
| このアプローチにより、アーキテクチャ選択の期間を数か月から数日に短縮できるとしている。 | [1] |
| コードと関連チェックポイントは公開予定。 | [1] |
なぜ重要か
この研究は、オンデバイスLLMの設計プロセスを根本的に変える可能性がある。ハードウェアとモデルの同時最適化により、開発期間の短縮と性能向上が期待でき、エッジAIの実用化を加速する。また、ハードウェア協調設計のスケーリング則を初めて体系的に提供した点で、今後の研究の基盤となるだろう。