何が起きたか

Hugging Faceは、ブログで「Asynchronous Robot Inference: Decoupling Action Prediction and Execution」と題した記事を公開し、ロボットの行動予測と実行を分離する非同期推論手法を紹介した。従来の逐次推論では、行動チャンクを順に実行するため、実行時の遅延や応答性の低下が生じる。非同期推論では、推論と実行を別プロセスで行い、PolicyServerとRobotClientの2コンポーネントで構成される。PolicyServerは加速ハードウェア上で推論を実行し、RobotClientは受信した行動をキューに蓄え、次のチャンクが計算されている間に実行する。通信にはgRPCを使用し、REST APIと比較して約5倍の性能を実現する。同社は、この手法をSmolVLAで導入し、タスク完了時間が約2倍高速化し、成功率は同等だったと報告している。

Key Facts

Hugging Faceは、ロボットの行動予測と実行を分離する非同期推論手法を公開した。[0]
非同期推論は、PolicyServerとRobotClientの2コンポーネントで構成される。[0]
PolicyServerは加速ハードウェア上で推論を実行し、RobotClientは受信した行動をキューに蓄え、次のチャンクが計算されている間に実行する。[0]
通信にはgRPCを使用し、REST APIと比較して約5倍の性能を実現する。[0]
同社は、この手法をSmolVLAで導入し、タスク完了時間が約2倍高速化し、成功率は同等だったと報告している。[0]

なぜ重要か

この手法は、ロボットの行動予測と実行を分離することで、実行時の遅延と応答性の低下を軽減する。これにより、ロボットが推論を待つことなく動作し続けることが可能となり、タスク完了時間の短縮が期待される。