何が起きたか

lerobotは、視覚・言語・行動を統合したロボット向けモデル「eo1-base」をHugging Faceで公開した。モデルはsafetensors形式で提供され、ベースモデルとしてIPEC-COMMUNITY/EO-1-3Bを利用している。

詳細

「eo1-base」は、視覚と言語と行動を統合したモデルで、ロボットの制御に用いられる。Hugging Faceのページでは、モデルカードに「vision-language-action」と記載されており、視覚と言語の入力から行動を生成することを目的としている。 ベースモデルには「IPEC-COMMUNITY/EO-1-3B」が指定されており、さらにファインチューニング用のベースモデルとしても同じ「IPEC-COMMUNITY/EO-1-3B」が指定されている。ライセンスはMITで、地域は米国(us)とされている。

Key Facts

lerobotが「eo1-base」をHugging Faceで公開した。[0]
モデルはsafetensors形式で提供される。[0]
モデルは視覚言語行動(vision-language-action)モデルである。[0]
ベースモデルはIPEC-COMMUNITY/EO-1-3Bである。[0]
ファインチューニング用のベースモデルもIPEC-COMMUNITY/EO-1-3Bである。[0]
ライセンスはMITである。[0]
地域は米国(us)とされている。[0]

なぜ重要か

視覚と言語から行動を生成するモデルの公開は、ロボットの制御における基盤技術の共有を促進する。MITライセンスにより、商用利用を含む幅広い活用が可能となる。