何が起きたか

Physical Intelligenceは、ロボットの視覚言語行動モデル(VLA)のリアルタイム実行を可能にするアルゴリズム「Real-Time Chunking (RTC)」を開発したと発表した。同社によると、VLAは数十億のパラメータを持ち、エッジデバイスでは推論サーバーとの通信遅延が生じる。従来のアクションチャンキングでは、チャンク切り替え時に不連続が生じる問題があった。同社はπ0、π0-FAST、π0.5では同期実行を行い、各チャンクを静止状態から開始していたが、チャンク間のポーズが問題だった。RTCは拡散・フローベースのVLAに適用可能で、トレーニング変更なしでリアルタイム実行を実現し、テストした全タスクで実行時間を短縮したとしている。

Key Facts

Physical Intelligenceは、ロボット向けのリアルタイム推論アルゴリズム「Real-Time Chunking (RTC)」を開発したと発表した。[0]
同社のVLAはチャンクサイズ50アクション(1秒相当)を使用している。[0]
π0、π0-FAST、π0.5では同期実行を行い、チャンク間でポーズが生じていた。[0]
RTCは拡散・フローベースのVLAに適用可能で、トレーニング変更なしで動作する。[0]
同社はRTCによりテストした全タスクで実行時間が短縮されたとしている。[0]

なぜ重要か

ロボットのVLAは実時間動作が求められるが、大規模モデルの推論遅延が課題となっている。RTCは同期実行によるポーズを排除し、リアルタイム実行を可能にする手法として、ロボットの応答性向上に寄与する可能性がある。