何が起きたか
Physical Intelligenceは、ロボットの視覚言語行動モデル(VLA)のリアルタイム実行を可能にするアルゴリズム「Real-Time Chunking (RTC)」を開発したと発表した。同社によると、VLAは数十億のパラメータを持ち、エッジデバイスでは推論サーバーとの通信遅延が生じる。従来のアクションチャンキングでは、チャンク切り替え時に不連続が生じる問題があった。同社はπ0、π0-FAST、π0.5では同期実行を行い、各チャンクを静止状態から開始していたが、チャンク間のポーズが問題だった。RTCは拡散・フローベースのVLAに適用可能で、トレーニング変更なしでリアルタイム実行を実現し、テストした全タスクで実行時間を短縮したとしている。
Key Facts
| Physical Intelligenceは、ロボット向けのリアルタイム推論アルゴリズム「Real-Time Chunking (RTC)」を開発したと発表した。 | [0] |
| 同社のVLAはチャンクサイズ50アクション(1秒相当)を使用している。 | [0] |
| π0、π0-FAST、π0.5では同期実行を行い、チャンク間でポーズが生じていた。 | [0] |
| RTCは拡散・フローベースのVLAに適用可能で、トレーニング変更なしで動作する。 | [0] |
| 同社はRTCによりテストした全タスクで実行時間が短縮されたとしている。 | [0] |
なぜ重要か
ロボットのVLAは実時間動作が求められるが、大規模モデルの推論遅延が課題となっている。RTCは同期実行によるポーズを排除し、リアルタイム実行を可能にする手法として、ロボットの応答性向上に寄与する可能性がある。