何が起きたか

Physical Intelligenceは、ロボット制御のための新しいアクショントークナイザー「FAST」を発表した。同社によると、FASTはJPEG画像に使われるような連続圧縮手法に着想を得ており、標準的なビニングによる離散化では不可能な高頻度・器用なタスクを処理できる。また、フローマッチングや拡散モデルと同等の器用さを達成しつつ、トレーニングが5倍高速であるとしている。FASTは、動作を言語と同様の離散トークンで表現することで、インターネット規模の事前学習からの転移を改善し、言語による指示追従を向上させるとしている。同社は、DROIDデータセットでポリシーを訓練し、特定のタスクを実行できるようにした初めての事例となったと述べている。

Key Facts

Physical Intelligenceは、ロボット制御向けの新しいアクショントークナイザー「FAST」を開発した。[0]
FASTは、JPEG画像に使われるような連続圧縮手法に着想を得ている。[0]
FASTは、標準的なビニングによる離散化では不可能な高頻度・器用なタスクを処理できる。[0]
FASTは、フローマッチングや拡散モデルと同等の器用さを達成しつつ、トレーニングが5倍高速である。[0]
FASTは、動作を離散トークンで表現することで、インターネット規模の事前学習からの転移を改善し、言語による指示追従を向上させるとしている。[0]
同社は、FASTによりDROIDデータセットでポリシーを訓練し、特定のタスクを実行できるようにした初めての事例となったと述べている。[0]

なぜ重要か

ロボット制御におけるトークン化の手法は、大規模モデルの学習効率と性能に大きな影響を与える。FASTは、従来のビニング方式の限界を克服し、拡散モデルと同等の器用さを保ちながらトレーニング時間を大幅に短縮することで、汎用ロボットポリシーの開発を加速させる可能性がある。