日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.24274

vla.simd: 言語条件付きマニピュレーションのための効率的なCPU推論

vla.simd: Efficient CPU Inference for Language-Conditioned Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

GPUなしで言語条件付きマニピュレーションを動かすため、SIMDカーネルと再利用計算を組み合わせたCPU推論エンジンvla.simdと、Raspberry Pi 5上で毎秒30動作以上を供給するACTベース方策IMPACTを提案した。

詳しい要約

1. どんなもの?

- 言語条件付きマニピュレーションをGPUなしで実行するためのCPU推論エンジンvla.simdを提案。 - 共有SIMDマイクロカーネル、再利用可能な計算、ターゲット固有の最適化を組み合わせる。 - 遅延実行と時間整合実行の下で、クエリ遅延と実行ホライズンをアクション可用性に関連付け、アクション供給とフィードバック頻度を区別する。 - 6つのポリシーと4つのCPUで評価し、コンパイル済みPyTorch参照に対して中央値約1.4倍の高速化を達成し、fp32数値忠実度を維持。 - IMPACTも導入:ACTベースのポリシーで、キャッシュされたテキスト表現と言語変調視覚特徴を持つ。 - Raspberry Pi 5上で90秒の熱ソーク後、fp32で33.5 actions/s、int8で81.2 actions/sを供給する唯一の言語条件付きポリシー。 - 別のGPU評価では、ロボット事前学習なしで4つのLIBEROスイートにわたり平均成功率76.4%。 - 命令シャッフルテストは馴染みのある目標間の選択を示す。 - SO-101アーム上のIMPACTとRobotiqグリッパ付きUR10e…

2. 先行研究と比べてどこがすごい?

- 従来の言語条件付きマニピュレーションは専用GPUを必要とすることが多いが、vla.simdはCPU推論エンジンでGPUなしでの展開を可能にする。 - コンパイル済みPyTorch参照と比較して、6ポリシー・4CPUで中央値約1.4倍の高速化を達成。 - IMPACTは評価セット内で唯一、Raspberry Pi 5上で少なくとも30 actions/sを供給する言語条件付きポリシー。 - ロボット事前学習なしでLIBEROスイートにわたり平均成功率76.4%を達成。 - アクション供給とフィードバック頻度を区別する点で、遅延実行と時間整合実行の理解を深める。

3. 技術・手法の肝は?

- 共有SIMDマイクロカーネル、再利用可能な計算、ターゲット固有の最適化を組み合わせたCPU推論エンジン。 - クエリ遅延と実行ホライズンをアクション可用性に関連付け、遅延実行と時間整合実行を区別。 - IMPACTはACTベースのポリシーで、キャッシュされたテキスト表現と言語変調視覚特徴を使用。 - fp32数値忠実度を維持しつつ、int8量子化もサポート。

4. どうやって有効だと検証した?

- 6つのポリシーと4つのCPUでvla.simdを評価し、コンパイル済みPyTorch参照に対する中央値約1.4倍の高速化を確認。 - fp32数値忠実度を維持することを検証。 - IMPACTをRaspberry Pi 5上で90秒の熱ソーク後に評価し、fp32で33.5 actions/s、int8で81.2 actions/sを供給。 - 別のGPU評価で4つのLIBEROスイートにわたり平均成功率76.4%を達成(ロボット事前学習なし)。 - 命令シャッフルテストで馴染みのある目標間の選択を実証。 - SO-101アーム上のIMPACTとRobotiqグリッパ付きUR10e上のSmolVLAの試行で、2つのロボットエンボディメントでのCPU展開を検証。

5. 議論はある?

- 要旨からは、vla.simdやIMPACTの限界、失敗事例、倫理的影響に関する議論は明示されていない。 - 熱ソーク後の性能低下やint8量子化の精度への影響についての詳細な議論は要旨からは不明。 - 異なるロボットエンボディメントへの一般化可能性や、他の言語条件付きポリシーとの比較に関する議論は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:ACTベースのポリシー(IMPACTの基盤)、SmolVLA(UR10eで使用)、LIBEROスイート(評価ベンチマーク)。 - 関連手法:コンパイル済みPyTorch参照、SIMD最適化、int8量子化。 - 同分野の定番:言語条件付きマニピュレーションのためのVLAモデル(例:RT-1, RT-2, Octo, OpenVLAなど)や、効率的な推論のための量子化・プルーニング手法。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Khanh D. Nguyen, Hoang M. Truong, An T. Le

分類: cs.RO, cs.AI, eess.SY

原文アブストラクト

Deploying language-conditioned manipulation without a dedicated GPU requires efficient inference and action chunks that cover the delay between policy queries. We present vla.simd, a CPU inference engine that combines shared SIMD micro-kernels, reusable computation, and target-specific optimization. We relate query latency and execution horizon to action availability under lagged and time-aligned execution, distinguishing action supply from feedback frequency. Across six policies and four CPUs, vla.simd achieves approximately $1.4\times$ median speedup over compiled PyTorch references while preserving fp32 numerical fidelity. We also introduce IMPACT, an ACT-based policy with cached text representations and language-modulated visual features. IMPACT is the only language-conditioned policy in our evaluated set that supplies at least 30 actions/s on the Raspberry Pi 5: after a 90 s thermal soak, it supplies 33.5 actions/s in fp32 and 81.2 with int8. Separate GPU evaluations yield $76.4\%$ mean success across four LIBERO suites without robot pretraining; instruction-shuffling tests demonstrate selection among familiar goals. Trials with IMPACT on an SO-101 arm and SmolVLA on a UR10e with a Robotiq gripper demonstrate CPU deployment on two robot embodiments.

関連論文

PR本紙発行元 EmplifAI