何が起きたか

Hugging Faceは、ロボット学習ライブラリLeRobotのバージョン0.6.0を公開した。今回のアップデートでは、未来を想像することを学習する世界モデルポリシーとして、VLA-JEPA、FastWAM、LingBot-VAの3つを導入した。また、GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiTなどの新しいVLA(Vision-Language-Actionモデル)を追加した。さらに、報酬モデルAPI(Robometer、TOPReward)を新設し、lerobot-evalとして統合された6つの新しいシミュレーションベンチマーク、DAggerスタイルの人間参加型修正を備えたlerobot-rollout CLI、FSDPトレーニング、HF Jobsでのクラウドトレーニングを提供する。データセットでは深度サポート、自動言語アノテーションパイプライン、カスタムビデオエンコーディング、最大2倍のデータロード高速化を実現し、インストールも簡素化された。

Key Facts

LeRobot v0.6.0が公開され、世界モデルポリシーとしてVLA-JEPA、FastWAM、LingBot-VAが追加された。[0]
新しいVLAとしてGR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiTが追加された。[0]
報酬モデルAPIとしてRobometerとTOPRewardが新設された。[0]
lerobot-evalとして統合された6つの新しいシミュレーションベンチマークが提供される。[0]
lerobot-rollout CLIはDAggerスタイルの人間参加型修正を備える。[0]
FSDPトレーニングとHF Jobsでのクラウドトレーニングがサポートされる。[0]
データセットは深度サポート、自動言語アノテーションパイプライン、カスタムビデオエンコーディング、最大2倍のデータロード高速化を実現。[0]
VLA-JEPAはQwen3-VL-2Bを基盤とし、トレーニング中にJEPAワールドモデルが将来のフレームを予測するが、推論時にはワールドモデルが消え、追加推論コストなしでワールドモデル監視が得られる。[0]
VLA-JEPAにはDROIDで事前学習されたベースモデルを含む3つのチェックポイントがHubで利用可能。[0]
LingBot-VAは自己回帰型ビデオアクションモデルで、将来のビデオとアクションをチャンク単位で予測し、実観測をフィードバックして想像を接地する。[0]
LingBot-VAは単一の24〜32GB GPUで推論が可能。[0]
FastWAMは約5Bのビデオ生成エキスパートとコンパクトなアクションエキスパートを単一ネットワークで組み合わせ、推論時にはドリーミングをスキップしてアクションチャンクを直接デノイズする。[0]

なぜ重要か

LeRobot v0.6.0は、ロボットポリシーにおける世界モデルの有効性を検証するための3つのポリシーを提供し、VLAの選択肢を拡大する。また、評価ベンチマークの統合や報酬モデルAPIの新設により、ロボット学習の研究・開発サイクルを効率化する可能性がある。