何が起きたか

Physical Intelligenceは、ロボットの視覚・言語・行動モデル(VLA)をリアルタイムで実行するためのアルゴリズム「real-time chunking (RTC)」を開発したと発表した。RTCは、拡散またはフローベースのVLAモデルに訓練時の変更なしで適用でき、実行時間を大幅に短縮し、高い遅延に対しても堅牢であるとしている。同社は、RTCを用いて、マッチでのろうそく点火やイーサネットケーブル挿入などの動的で精密なタスクを、300ミリ秒以上の推論遅延で完了したと報告している。

詳細

Physical Intelligenceは、ロボットがリアルタイムで動作するためには、モデルが推論している間に世界が変化するため、入力と出力の遅延が性能に影響を与えると指摘する。VLAは数十億のパラメータを持ち、GPUを必要とするため、エッジデバイスでは推論サーバーとの通信遅延がさらに増加する。同社は、非同期処理を実現するためにアクション・チャンキングを導入し、各推論で50アクション(実時間1秒)を出力する。しかし、チャンク切り替え時に不連続性が生じ、安全でない加速度を引き起こす可能性があるため、従来のπ0、π0-FAST、π0.5では同期実行を行い、チャンク間の休止を導入していた。この休止は訓練データに含まれておらず、速度低下や見た目の悪さ、モデル規模拡大の妨げとなっていた。 RTCは、この問題をインペインティング問題として定式化することで解決する。新しいチャンクの最初の数アクションは、生成中に実行済みのタイムステップに対応するため、前のチャンクの値に固定し、残りのアクションをインペインティングで埋める。さらに、中間のアクションには部分的に注意を向けることで、モデルの反応性を保ちつつ、一貫した戦略を維持する。拡散・フローモデルは画像インペインティングに優れており、この手法を適用することで、訓練時の変更なしにπ0やπ0.5に適用できる。 実験では、同期推論と比較してRTCの速度と精度を評価した。ろうそく点火とイーサネットケーブル挿入という短時間で高精度なタスクに加え、標準的な長時間タスクもテストした。また、+100msと+200msの人工遅延を注入した場合の性能も調査し、+200msではモバイルマニピュレータの総推論遅延が3分の1秒以上になることを確認した。RTCは、モデル規模の拡大やクラウド推論、異なるエンボディメントへの対応など、将来の遅延増加に対処するための動機付けとなっている。

Key Facts

Physical Intelligenceは、ロボットのVLAモデルをリアルタイムで実行するアルゴリズム「real-time chunking (RTC)」を開発した。[0]
RTCは、拡散またはフローベースのVLAモデルに訓練時の変更なしで適用できる。[0]
同社のVLAはすべてチャンクサイズ50アクション(実時間1秒)を使用している。[0]
従来のπ0、π0-FAST、π0.5では同期実行を行い、チャンク間の休止が発生していた。[0]
RTCは、マッチでのろうそく点火やイーサネットケーブル挿入などのタスクを、300ミリ秒以上の推論遅延で完了した。[0]
RTCは、チャンクの一貫性をインペインティング問題として定式化し、前のチャンクの残りアクションを利用する。[0]
実験では、+100msと+200msの人工遅延を注入し、+200msではモバイルマニピュレータの総推論遅延が3分の1秒以上になった。[0]
RTCは、モデル規模の拡大やクラウド推論、異なるエンボディメントへの対応など、将来の遅延増加に対処するための動機付けとなっている。[0]

なぜ重要か

この技術は、ロボットのVLAモデルを実用的な速度で実行することを可能にし、ロボットの応答性と安全性を向上させる。RTCは訓練時の変更を必要としないため、既存のモデルに容易に適用でき、ロボットのリアルタイム制御の進展に寄与する。