日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/エッジ推論arXiv:2608.04428

Deltoris: ビットレベル疎性と投機的推論による具現化AIのリアルタイムVLA推論の実現

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

シェア:XThreadsFacebookLINEはてブBluesky

拡散ベースのVLAモデルのエッジでの高速推論を実現するため、時間的類似性を利用したビット疎性アルゴリズムと投機的推論、専用アクセラレータを設計した。

詳しい要約

1. どんなもの?

Deltorisは、拡散ベースのVision-Language-Action (VLA)モデルの推論をエッジデバイス上でリアルタイムに実行するためのアルゴリズム-ハードウェア協調設計フレームワークである。拡散ベースのVLAモデルは高品質な動作生成と汎化を実現するが、計算集約的であり、50-200 Hzの高い制御周波数で動作する必要があるため、エッジデバイス上でのレイテンシとエネルギー制約が厳しい。Deltorisはこの問題を解決するために、時間的類似性を利用したビットレベルのスパーシティと投機的推論を導入し、専用アクセラレータを設計する。

2. 先行研究と比べてどこがすごい?

先行研究と比較して、Deltorisは拡散ベースのVLAモデルに特化した効率的な推論手法を提案している点が優れている。従来のアクセラレータやモバイルGPUと比較して、時間的類似性を利用したビットスパーシティにより冗長な計算を削減し、さらに投機的推論でデータロードを複数ステップに償却することで、オフチップトラフィックを削減する。また、専用の1D systolic bit-serial PEアレイによりPEのワークロード不均衡を解消し、最大34.2倍のモバイルGPU比、6.1倍の先行アクセラレータ比の高速化を達成している。

3. 技術・手法の肝は?

技術の肝は、まず時間的類似性を利用したtemporal-aware bit-sparsityアルゴリズムで、連続する入力間の差分のみを計算し、ビットレベルの冗長な演算を排除することである。次に、このアルゴリズムが引き起こす追加のオフチップトラフィックを補うために、speculative inference技術を導入し、データロードを複数の制御ステップにわたって償却する。さらに、これらの技術をサポートするために、専用アクセラレータを設計し、カスタムの1D systolic bit-serial PEアレイを用いてPEのワークロード不均衡を解消する。

4. どうやって有効だと検証した?

有効性の検証は、モバイルGPUと先行アクセラレータとの比較評価によって行われた。その結果、DeltorisはモバイルGPUに対して最大34.2倍、先行アクセラレータに対して6.1倍の高速化を達成し、精度は同等に維持されることが示された。具体的な評価環境やデータセットは要旨からは不明である。

5. 議論はある?

議論としては、提案手法は拡散ベースのVLAモデルに特化しており、他のタイプのVLAモデルや一般的なモデルへの適用可能性は不明である。また、speculative inferenceの精度への影響や、ハードウェア設計の複雑さ、実際のエッジデバイスへの統合時のオーバーヘッドなどが考慮されるべき点として挙げられる。しかし、要旨からはこれらの詳細は不明である。

6. 次に読むべき論文は?

次に読むべき論文としては、要旨で参照されている先行アクセラレータの研究や、拡散ベースのVLAモデルの基礎となる研究が挙げられる。具体的には、拡散モデルを用いたVLAモデルの提案論文や、ビットスパーシティを利用した推論最適化の研究、およびエッジAI向けのアクセラレータ設計に関する論文が関連する。ただし、要旨に明示的な参照がないため、同分野の定番である拡散モデルやVLAモデルの論文を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

分類: cs.AR, cs.LG

原文アブストラクト

Vision-language-action (VLA) models have emerged as a key component in embodied AI. Among existing approaches, diffusion-based VLA models achieve superior motion quality and generalization. However, diffusion-based VLA models are compute-intensive and must run at high control frequency, e.g., 50-200 Hz. Thus, it imposes strict latency and energy constraints on edge devices. In this work, we present Deltoris, an algorithm-hardware co-design framework for efficient diffusion-based VLA inference. First, we exploit the temporal similarity of consecutive inputs and propose a \textit{temporal-aware bit-sparsity} algorithm that computes only the differences between consecutive inputs, eliminating redundant bit-level operations. To further address the extra off-chip traffic introduced by our algorithm, we propose a \textit{speculative inference} technique, which amortizes data loading across multiple control steps. Lastly, to support these techniques, we co-design a dedicated accelerator with customized 1D systolic bit-serial PE arrays that eliminate PE workload imbalance. Our evaluation shows that Deltoris achieves up to 34.2$\times$ speedup over mobile GPUs and 6.1$\times$ over prior accelerators, while maintaining comparable accuracy.

関連論文