何が起きたか
2026年8月5日、arXivにプレプリント「Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference」が公開された。Deltorisは拡散型VLAモデルの推論を高速化するためのアルゴリズム・ハードウェア協調設計フレームワークであり、評価ではモバイルGPUと比較して最大34.2倍、既存アクセラレータと比較して最大6.1倍の高速化を達成したと報告されている。
詳細
Deltorisは、拡散型VLAモデルのエッジ推論におけるレイテンシとエネルギー制約に対処する。具体的には、連続する入力間の時間的類似性を利用した「temporal-aware bit-sparsity」アルゴリズムを提案し、連続入力間の差分のみを計算することで冗長なビット演算を排除する。さらに、このアルゴリズムによって生じるオフチップデータ転送の増加を補うため、「speculative inference」技術を導入し、データロードを複数の制御ステップに分散させる。これらの技術をサポートするため、カスタム設計の1次元シストリックビットシリアルPEアレイを備えた専用アクセラレータを設計し、PEワークロードの不均衡を解消している。評価では、精度を維持しながら、モバイルGPU比で最大34.2倍、既存アクセラレータ比で最大6.1倍の高速化を達成したとしている。
Key Facts
| Deltorisは拡散型VLAモデルの推論を高速化するアルゴリズム・ハードウェア協調設計フレームワークである。 | 出典一覧 |
| Deltorisは時間的ビット疎性アルゴリズムと投機的推論技術を提案している。 | 出典一覧 |
| DeltorisはモバイルGPUと比較して最大34.2倍、既存アクセラレータと比較して最大6.1倍の高速化を達成したと報告されている。 | 出典一覧 |
| Deltorisは精度を維持しながら高速化を実現しているとしている。 | 出典一覧 |
本紙の見方
今回の発表は、拡散型VLAモデルのエッジ推論における計算負荷とレイテンシ制約という課題に対し、アルゴリズムとハードウェアの両面からアプローチした点で新規性がある。特に、連続入力間の時間的類似性に着目したビット疎性は、従来の空間的疎性とは異なる次元の最適化であり、拡散モデルの反復的な推論プロセスに適した手法とみられる。また、投機的推論によるデータロードの平準化は、メモリ帯域幅がボトルネックとなるエッジデバイスでの実用性を高める工夫だ。 本紙の過去報道との接続はないが、この技術はエンボディAI分野におけるVLAモデルの実用化を後押しする可能性がある。拡散型VLAは高品質な動作生成が可能だが、その計算コストからエッジでのリアルタイム実行が難しかった。Deltorisの高速化により、ロボットやドローンなどでの実時間制御が現実味を帯びる。 業界構造への含意としては、専用アクセラレータの設計が示すように、VLA推論に特化したハードウェアの需要が高まる可能性がある。また、アルゴリズムとハードウェアの協調設計は、半導体企業とAI研究者の連携を促進するだろう。 未確定の論点としては、実際のエッジデバイスでの消費電力やメモリ使用量の詳細、他のVLAモデルへの適用可能性、量産時の性能などが挙げられる。また、34.2倍という高速化が特定の条件下での数値である可能性もあり、実環境での検証が待たれる。
なぜ重要か
Deltorisは、拡散型VLAモデルのエッジ推論を高速化する手法を提示し、エンボディAIのリアルタイム応用への道を開く可能性がある。この技術は、ロボットや自動運転など、高い制御周波数が求められる分野でのVLAモデル採用を後押しするだろう。