何が起きたか
2026年8月5日、arXivにプレプリント「Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference」が公開された。Deltorisは拡散型VLAモデルの推論を高速化するためのアルゴリズム・ハードウェア協調設計フレームワークであり、評価ではモバイルGPUと比較して最大34.2倍、既存アクセラレータと比較して最大6.1倍の高速化を達成したと報告されている。
詳細
Deltorisは、拡散型VLAモデルのエッジ推論におけるレイテンシとエネルギー制約に対処する。具体的には、連続する入力間の時間的類似性を利用した「temporal-aware bit-sparsity」アルゴリズムを提案し、連続入力間の差分のみを計算することで冗長なビット演算を排除する。さらに、このアルゴリズムによって生じるオフチップデータ転送の増加を補うため、「speculative inference」技術を導入し、データロードを複数の制御ステップに分散させる。これらの技術をサポートするため、カスタム設計の1次元シストリックビットシリアルPEアレイを備えた専用アクセラレータを設計し、PEワークロードの不均衡を解消している。評価では、精度を維持しながら、モバイルGPU比で最大34.2倍、既存アクセラレータ比で最大6.1倍の高速化を達成したとしている。
Key Facts
| Deltorisは拡散型VLAモデルの推論を高速化するアルゴリズム・ハードウェア協調設計フレームワークである。 | [1] |
| Deltorisは時間的ビット疎性アルゴリズムと投機的推論技術を提案している。 | [1] |
| DeltorisはモバイルGPUと比較して最大34.2倍、既存アクセラレータと比較して最大6.1倍の高速化を達成したと報告されている。 | [1] |
| Deltorisは精度を維持しながら高速化を実現しているとしている。 | [1] |
なぜ重要か
Deltorisは、拡散型VLAモデルのエッジ推論を高速化する手法を提示し、エンボディAIのリアルタイム応用への道を開く可能性がある。この技術は、ロボットや自動運転など、高い制御周波数が求められる分野でのVLAモデル採用を後押しするだろう。