何が起きたか
ciplab-roboticsは、低コストハードウェアで高精度な両腕操作を実現するポリシー「my_policy_pnp_candy」をHugging Face Hubで公開した。このポリシーは、模倣学習手法の一種であるAction Chunking with Transformers (ACT)を用いて訓練されており、LeRobotフレームワークで利用可能。
詳細
このポリシーは、Hugging Face Hub上のリポジトリ「ciplab-robotics/my_policy_pnp_candy」で公開されている。リポジトリの説明によると、ACTは模倣学習手法の一種で、単一ステップではなく短いアクションのチャンクを予測する。遠隔操作データから学習し、高い成功率を達成することが多いとされる。 このポリシーは、LeRobotを使用して訓練され、Hubにプッシュされた。LeRobotのドキュメントには、訓練と推論/評価の実行方法が記載されている。訓練コマンドの例では、`lerobot-train`を使用し、データセットのリポジトリID、ポリシータイプ(act)、出力ディレクトリ、ジョブ名、デバイス(cuda)、ポリシーのリポジトリID、WandBの有効化などの引数を指定する。チェックポイントは`outputs/train/<desired_policy_repo_id>/checkpoints/`に書き込まれる。 評価コマンドの例では、`lerobot-record`を使用し、ロボットタイプ(so100_follower)、データセットのリポジトリID(eval_プレフィックス付き)、ポリシーのパス、エピソード数(10)を指定する。
Key Facts
| ciplab-roboticsは、ポリシー「my_policy_pnp_candy」をHugging Face Hubで公開した。 | [0] |
| このポリシーは、論文「Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware」に関連する。 | [0] |
| ポリシーは、Action Chunking with Transformers (ACT)を用いて訓練された。 | [0] |
| ACTは、単一ステップではなく短いアクションのチャンクを予測する模倣学習手法である。 | [0] |
| ACTは遠隔操作データから学習し、高い成功率を達成することが多いとされる。 | [0] |
| ポリシーはLeRobotを使用して訓練され、Hubにプッシュされた。 | [0] |
| 訓練コマンドでは、`lerobot-train`を使用し、ポリシータイプに`act`を指定する。 | [0] |
| チェックポイントは`outputs/train/<desired_policy_repo_id>/checkpoints/`に書き込まれる。 | [0] |
| 評価コマンドでは、`lerobot-record`を使用し、ロボットタイプに`so100_follower`を指定する。 | [0] |
| 評価時のエピソード数は10と指定されている。 | [0] |
なぜ重要か
この公開は、低コストなハードウェアで高精度な両腕操作を実現する模倣学習ポリシーをコミュニティが利用可能にした点で重要である。LeRobotフレームワークとの統合により、再現性と応用のしやすさが向上する。