何が起きたか
2025年1月16日にarXivに公開された論文で、Frequency-space Action Sequence Tokenization (FAST) という新しいロボット行動のトークン化手法が提案された。FASTは離散コサイン変換を用いた圧縮ベースの手法で、高周波・器用なタスクで従来の単純なビニング手法が失敗する問題を解決する。FAST+は100万の実ロボット行動軌道で訓練された汎用トークナイザーであり、pi0 VLAと組み合わせることで拡散VLAに匹敵する性能を達成し、訓練時間を最大5倍短縮する。
詳細
FASTは、自己回帰型の視覚言語行動モデル(VLA)における連続行動信号のトークン化を扱う。従来の次元・時間ステップごとのビニング方式は、高周波データからの器用なスキル学習で性能が低いとされる。FASTは離散コサイン変換に基づく圧縮方式で、この問題に対処する。FAST+は100万の実ロボット行動軌道で訓練された汎用トークナイザーで、多様な行動空間と制御周波数に対応するブラックボックスとして利用できる。pi0 VLAと組み合わせた場合、1万時間のロボットデータで訓練でき、拡散VLAの性能に匹敵しつつ、訓練時間を最大5倍短縮する。
Key Facts
| FASTは離散コサイン変換に基づく圧縮ベースの行動トークン化手法である。 | [1] |
| FAST+は100万の実ロボット行動軌道で訓練された汎用トークナイザーである。 | [1] |
| FASTをpi0 VLAと組み合わせると、1万時間のロボットデータで訓練でき、拡散VLAに匹敵する性能を達成する。 | [1] |
| FASTを使用すると、訓練時間を最大5倍短縮できる。 | [1] |
| 従来の単純なビニング方式は、高周波データからの器用なスキル学習で性能が低いとされる。 | [1] |
なぜ重要か
FASTはロボット行動の表現方法を変える可能性があり、自己回帰型VLAの実用性を高める。これにより、ロボットの器用な操作タスクの学習が加速し、産業や家庭でのロボット応用が進む基盤となる。また、訓練時間の短縮は開発コストの削減につながり、ロボット学習の民主化に寄与するだろう。