何が起きたか

Scaling Roboticsは、Hugging Face Hub上で「alicia-policy-act-20260505」というポリシーを公開した。このポリシーは、Action Chunking with Transformers (ACT)という模倣学習手法を用いており、遠隔操作データから学習する。同社は、このポリシーがLeRobotを使用して訓練され、Hubにプッシュされたと説明している。

詳細

公開されたポリシーは、Hugging Face Hubのリポジトリ「scaling-robotics/alicia-policy-act-20260505」で提供されている。ACTは、単一のステップではなく短いアクションのチャンクを予測する模倣学習手法であり、遠隔操作データから学習し、高い成功率を達成することが多いとされる。 このポリシーは、LeRobotを使用して訓練され、Hubにプッシュされた。LeRobotのドキュメントには、訓練と推論/評価の実行方法が記載されている。訓練コマンドの例では、データセットのリポジトリID、ポリシータイプ、出力ディレクトリ、ジョブ名、デバイス、ポリシーのリポジトリID、WandBの有効化などが指定されている。 評価用のデータ記録コマンドでは、ロボットタイプとして「so100_follower」が指定され、データセットのリポジトリIDに「eval_」プレフィックスを付け、ポリシーのパスを指定する。エピソード数は10と設定されている。

Key Facts

Scaling Roboticsは、Hugging Face Hubで「alicia-policy-act-20260505」というポリシーを公開した。[0]
このポリシーは、Action Chunking with Transformers (ACT)という模倣学習手法を用いている。[0]
ACTは、単一のステップではなく短いアクションのチャンクを予測する手法である。[0]
このポリシーは、遠隔操作データから学習し、高い成功率を達成することが多いとされる。[0]
このポリシーは、LeRobotを使用して訓練され、Hugging Face Hubにプッシュされた。[0]
訓練コマンドの例では、データセットのリポジトリID、ポリシータイプ、出力ディレクトリ、ジョブ名、デバイス、ポリシーのリポジトリID、WandBの有効化が指定されている。[0]
評価用のデータ記録コマンドでは、ロボットタイプとして「so100_follower」が指定されている。[0]
評価用データセットのリポジトリIDには「eval_」プレフィックスを付け、ポリシーのパスを指定する。[0]
評価用データ記録のエピソード数は10と設定されている。[0]

なぜ重要か

この公開は、模倣学習を用いたロボットポリシーの共有を促進するものであり、LeRobotエコシステムの活用例を示している。ACT手法の実装例として、他の研究者や開発者が参照できる。