何が起きたか
Hugging Faceは、ロボット学習ライブラリLeRobotのバージョン0.6.0を公開した。今回のアップデートでは、未来を想像することを学習する世界モデルポリシーとして、VLA-JEPA、FastWAM、LingBot-VAの3つを導入した。また、GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiTなどの新しいVLA(Vision-Language-Actionモデル)を追加した。さらに、報酬モデルAPI(Robometer、TOPReward)を新設し、lerobot-evalとして統合された6つの新しいシミュレーションベンチマーク、DAggerスタイルの人間参加型修正を備えたlerobot-rollout CLI、FSDPトレーニング、HF Jobsでのクラウドトレーニングを提供する。データセットでは深度サポート、自動言語アノテーションパイプライン、カスタムビデオエンコーディング、最大2倍のデータロード高速化を実現し、インストールも簡素化された。
Key Facts
| LeRobot v0.6.0が公開され、世界モデルポリシーとしてVLA-JEPA、FastWAM、LingBot-VAが追加された。 | [0] |
| 新しいVLAとしてGR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiTが追加された。 | [0] |
| 報酬モデルAPIとしてRobometerとTOPRewardが新設された。 | [0] |
| lerobot-evalとして統合された6つの新しいシミュレーションベンチマークが提供される。 | [0] |
| lerobot-rollout CLIはDAggerスタイルの人間参加型修正を備える。 | [0] |
| FSDPトレーニングとHF Jobsでのクラウドトレーニングがサポートされる。 | [0] |
| データセットは深度サポート、自動言語アノテーションパイプライン、カスタムビデオエンコーディング、最大2倍のデータロード高速化を実現。 | [0] |
| VLA-JEPAはQwen3-VL-2Bを基盤とし、トレーニング中にJEPAワールドモデルが将来のフレームを予測するが、推論時にはワールドモデルが消え、追加推論コストなしでワールドモデル監視が得られる。 | [0] |
| VLA-JEPAにはDROIDで事前学習されたベースモデルを含む3つのチェックポイントがHubで利用可能。 | [0] |
| LingBot-VAは自己回帰型ビデオアクションモデルで、将来のビデオとアクションをチャンク単位で予測し、実観測をフィードバックして想像を接地する。 | [0] |
| LingBot-VAは単一の24〜32GB GPUで推論が可能。 | [0] |
| FastWAMは約5Bのビデオ生成エキスパートとコンパクトなアクションエキスパートを単一ネットワークで組み合わせ、推論時にはドリーミングをスキップしてアクションチャンクを直接デノイズする。 | [0] |
なぜ重要か
LeRobot v0.6.0は、ロボットポリシーにおける世界モデルの有効性を検証するための3つのポリシーを提供し、VLAの選択肢を拡大する。また、評価ベンチマークの統合や報酬モデルAPIの新設により、ロボット学習の研究・開発サイクルを効率化する可能性がある。