何が起きたか

arXivに2026年10月8日掲載された論文「Being-M0.7: A Latent World-Action Model for Humanoid Robots」は、ヒューマノイドの移動とマニピュレーションを扱うlatent world-action modelを提示した。著者らは、10,000時間超の人間中心データを集め、動画のみ・モーションのみ・動画とモーションのペアを含むコーパスを組み合わせて学習した。論文では、この表現を基にSIMPLEで比較対象中の最高の総合成功率を示し、実機のUnitree G1タスクでは最強ベースラインに並んだとしている。

詳細

モデルは、前処理としてのpre-training、ロボット視点と身体ダイナミクスへの適応を行うrobot mid-training、実行可能な全身コマンドへつなぐaction post-trainingの3段階で構成される。action post-trainingでは、凍結された適応済みpriorから得た視覚予測表現を、現在画像とproprioceptionとともにgated cross-attentionで統合する設計である。 データ面では、著者らは10,000時間超のraw human-centric dataをまとめ、video-only、motion-only、paired video-motion streamsを統合したとしている。論文は、未来のlatent visual statesとmotionの同時予測により、視覚表現が将来のkinematicsを符号化しやすくなるとしている。

Key Facts

論文名は「Being-M0.7: A Latent World-Action Model for Humanoid Robots」である。[1]
掲載日は2026年10月8日である。[1]
10,000時間超のraw human-centric dataを用いている。[1]
video-only、motion-only、paired video-motion streamsを統合して学習した。[1]
SIMPLEで比較対象中の最高のaggregate success rateを達成し、実機のUnitree G1 loco-manipulation tasksでは最強ベースラインに並んだとしている。[1]

本紙の見方

この論文の新しさは、ヒューマノイド制御を「人間データの規模拡大」だけでなく、「動画・モーション・ペアデータの混在をどう一つのlatent world-action modelに束ねるか」に置いている点にある。10,000時間超という量そのものも重要だが、単一形式の模倣ではなく、視覚予測と全身運動の両方を事前学習でつなぎ、さらにrobot mid-trainingとaction post-trainingでロボット実機の視点・身体差分を吸収する三段構えが主軸である。ここではデータ量、表現学習、実機適応が一体化しており、従来の「データを増やす」路線の延長でありつつ、学習段階の切り分けが具体的である。 本紙の見方では、この記事はヒューマノイド向け基盤モデルの議論を、静的な認識ではなく「未来のシーン変化を予測しながら全身行動を出す」方向へ寄せるものといえる。論文が強調するのは、human motionがそのままrobot actionを指示しないという前提であり、そこをgated cross-attentionで現在画像とproprioceptionに接地させている点だ。つまり、単なる人間動画の大量投入ではなく、ロボットが実行可能なコマンド表現へ変換する接続部が核心である。これは、同じ人間データでも「何を予測表現として残し、何をロボット側で再解釈するか」が勝負になることを示す。 業界構造への含意としては、競争軸がロボット本体の機械性能だけでなく、データの型と学習工程の設計に移っていることが読み取れる。video-only、motion-only、paired video-motionの3種を統合できるかどうかは、データ調達の幅と表現学習の柔軟性を左右する。加えて、実機のUnitree G1で最強ベースラインに並んだという記述は、シミュレーションやオフライン指標だけでなく、実機での接地が評価軸として残ることを示す。もっとも、SIMPLEでの比較対象、Unitree G1タスクの条件、10,000時間超のデータの内訳や収集方法は、この要約だけでは粒度が足りない。どの形式のデータが性能にどれだけ寄与したのか、mid-trainingとpost-trainingの役割分担がどこまで一般化するのかが次の確認点になる。

なぜ重要か

著者らは、10,000時間超の人間中心データと3段階の学習で、ヒューマノイド制御に必要な予測表現と実行可能な行動をつないだとしている。これは、実機ロボットに使える学習データの形式が単なる動画かモーションかではなく、その接続のさせ方に左右されることを示す。

日本への影響

日本のヒューマノイド開発では、実機評価だけでなく、動画・モーション・ペアデータをどう揃えて学習に入れるかが焦点になりうる。論文が示したようなgated cross-attentionによる接地が前提になるなら、ロボット本体の制御に加えて、人間動作データの整備や、現在画像・proprioceptionを含む学習基盤の設計が競争力を左右するとみられる。