何が起きたか
Physical Intelligenceは、ロボットの行動系列を高密度な離散トークンに変換するアクショントークナイザー「FAST」を公開した。このトークナイザーは、視覚言語行動モデル(VLA)の訓練に使用される。Hugging Face上で「lerobot/fast-action-tokenizer」として提供されており、Transformersライブラリから直接読み込むことができる。
詳細
FASTは、任意のロボット行動系列を、自己回帰型VLAモデルの訓練用に高密度な離散トークン系列にマッピングする。公式リポジトリでは、100万の実ロボット行動系列で訓練された汎用トークナイザー「FAST+」と、カスタムデータセットで新しいトークナイザーを迅速に訓練するためのコードが提供されている。 FASTはHugging FaceのAutoProcessorとして利用でき、transformersパッケージとscipyをインストールするだけで使用可能。推奨される使用方法は、[-1, 1]の範囲に事前正規化された1秒間のアクションチャンクに適用すること。エンコードとデコードはバッチ推論をサポートしている。 カスタムトークナイザーの訓練は、.fit()関数を使用して簡単に行える。データセットのアクションチャンク(長さが異なっても可)に対して呼び出すと、新しいトークナイザーインスタンスが返され、保存してHugging Faceハブにプッシュできる。訓練時間は通常数秒から数分。
Key Facts
| Physical Intelligenceは、ロボットの行動系列を離散トークンに変換するアクショントークナイザー「FAST」を公開した。 | [0] |
| FASTは、自己回帰型VLAモデルの訓練用に、任意のロボット行動系列を高密度な離散トークン系列にマッピングする。 | [0] |
| FAST+は、100万の実ロボット行動系列で訓練された汎用トークナイザーである。 | [0] |
| FASTはHugging FaceのAutoProcessorとして利用でき、transformersパッケージとscipyをインストールするだけで使用可能。 | [0] |
| 推奨される使用方法は、[-1, 1]の範囲に事前正規化された1秒間のアクションチャンクに適用すること。 | [0] |
| エンコードとデコードはバッチ推論をサポートしている。 | [0] |
| カスタムトークナイザーの訓練は.fit()関数で行え、訓練時間は通常数秒から数分。 | [0] |
| 訓練したトークナイザーは保存してHugging Faceハブにプッシュできる。 | [0] |
なぜ重要か
FASTは、ロボットの行動を離散トークンに変換することで、VLAモデルの訓練を効率化する。100万の実ロボット行動系列で訓練されたFAST+は、多様なロボット構成や行動次元、制御周波数で良好に機能するとされており、ロボット学習の標準的なツールとなる可能性がある。