何が起きたか

研究チームは2025年7月21日、arxiv.orgにプレプリント「Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos」を公開した。Being-H0は、大規模な人間の動画を利用して訓練された器用なVLAモデルであり、複雑な操作タスクや新規シナリオへの一般化を目指す。

詳細

Being-H0は、人間の手を基盤マニピュレータとして活用し、ウェブデータの豊富な器用さとスケーラビリティを利用する。訓練パラダイムとして「物理的指示チューニング」を導入し、大規模な人間動画からのVLA事前学習、3D推論のための物理空間アライメント、ロボットタスクへの後訓練適応を組み合わせる。また、部品レベルの動作トークン化手法を導入し、ミリメートル級の再構築精度を達成したとしている。データキュレーションパイプラインにより、モーションキャプチャ、VR、RGBのみの動画など異種ソースを統合し、数百万の動作ベースの指示インスタンスを含む大規模データセットを構築した。

Key Facts

Being-H0は、大規模な人間の動画で訓練された器用なVision-Language-Actionモデルである。[1]
物理的指示チューニングは、大規模な人間動画からのVLA事前学習、物理空間アライメント、後訓練適応を組み合わせた訓練パラダイムである。[1]
部品レベルの動作トークン化手法は、ミリメートル級の再構築精度を達成したとされる。[1]
データキュレーションパイプラインは、モーションキャプチャ、VR、RGBのみの動画を統合し、数百万の動作ベースの指示インスタンスを含むデータセットを構築した。[1]
実世界のロボット操作において、物理的指示チューニングの適用によりBeing-H0の期待される利得が観察された。[1]

なぜ重要か

Being-H0は、ロボット学習のデータ調達方法を変える可能性を秘めており、人間の動画を活用することで、これまで困難だった複雑な操作タスクへの一般化を進める一歩となる。実世界での応用が進めば、産業用ロボットやサービスロボットの適応範囲が広がり、ロボット開発のコスト構造にも影響を与えるとみられる。