何が起きたか

Physical Intelligenceは、ロボットの行動系列を高密度な離散トークンに変換するアクショントークナイザー「FAST」を公開した。このトークナイザーは、視覚言語行動モデル(VLA)の訓練に使用される。Hugging Face上で「lerobot/fast-action-tokenizer」として提供されており、Transformersライブラリから直接読み込むことができる。

詳細

FASTは、任意のロボット行動系列を、自己回帰型VLAモデルの訓練用に高密度な離散トークン系列にマッピングする。公式リポジトリでは、100万の実ロボット行動系列で訓練された汎用トークナイザー「FAST+」と、カスタムデータセットで新しいトークナイザーを迅速に訓練するためのコードが提供されている。 FASTはHugging FaceのAutoProcessorとして利用でき、transformersパッケージとscipyをインストールするだけで使用可能。推奨される使用方法は、[-1, 1]の範囲に事前正規化された1秒間のアクションチャンクに適用すること。エンコードとデコードはバッチ推論をサポートしている。 カスタムトークナイザーの訓練は、.fit()関数を使用して簡単に行える。データセットのアクションチャンク(長さが異なっても可)に対して呼び出すと、新しいトークナイザーインスタンスが返され、保存してHugging Faceハブにプッシュできる。訓練時間は通常数秒から数分。

Key Facts

Physical Intelligenceは、ロボットの行動系列を離散トークンに変換するアクショントークナイザー「FAST」を公開した。[0]
FASTは、自己回帰型VLAモデルの訓練用に、任意のロボット行動系列を高密度な離散トークン系列にマッピングする。[0]
FAST+は、100万の実ロボット行動系列で訓練された汎用トークナイザーである。[0]
FASTはHugging FaceのAutoProcessorとして利用でき、transformersパッケージとscipyをインストールするだけで使用可能。[0]
推奨される使用方法は、[-1, 1]の範囲に事前正規化された1秒間のアクションチャンクに適用すること。[0]
エンコードとデコードはバッチ推論をサポートしている。[0]
カスタムトークナイザーの訓練は.fit()関数で行え、訓練時間は通常数秒から数分。[0]
訓練したトークナイザーは保存してHugging Faceハブにプッシュできる。[0]

なぜ重要か

FASTは、ロボットの行動を離散トークンに変換することで、VLAモデルの訓練を効率化する。100万の実ロボット行動系列で訓練されたFAST+は、多様なロボット構成や行動次元、制御周波数で良好に機能するとされており、ロボット学習の標準的なツールとなる可能性がある。