何が起きたか

arXivは2026年9月16日、全身動作の大規模・異種データを使ってヒューマノイド向け世界行動モデルを学習する論文「WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors」を公開した。論文は、対象ロボットの軌道収集は高コストで拡張しにくい一方、人体とヒューマノイドの全身動作データは豊富だとして、その動作資源を予測的な事前知識として転用する枠組みを提案している。

詳細

論文では、4K時間超の人間動画、ネイティブ3Dモーションデータセット、異種のヒューマノイド・プラットフォームをまたぐ動作コーパス「UniMotion-4K」を整備し、これらを単一のモーション空間に正規化したうえで学習に用いた。まず言語条件付きの「Motion Expert」を事前学習して、対象ロボットの行動監督なしに将来の全身動作を予測させる。その後、ロボット段階学習では、このMotion ExpertをVideo ExpertとAction Expertに非対称Mixture-of-Transformers(MoT)注意で統合し、場面ダイナミクスと全身動作をあわせて行動生成に反映させる設計である。

Key Facts

論文名は「WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors」である[1]
公開日は2026-09-16である[1]
UniMotion-4Kは4K時間超の動作コーパスである[1]
コーパスはhuman videos、native 3D motion datasets、heterogeneous humanoid platformsを含む[1]
ロボット段階学習ではMotion ExpertをVideo ExpertとAction Expertに非対称Mixture-of-Transformers(MoT)注意で統合する[1]

本紙の見方

この論文の新しさは、ヒューマノイド操作を「対象ロボットの実機デモ収集」から出発させず、4K時間超の人間動画と3Dモーション、異種ヒューマノイドの動作を一つの予測事前分布にまとめて使う点にある。既定路線の延長としては、言語条件付きの予測器を先に学習し、その後にロボット向けの行動生成へつなぐ構成自体は、近年の基盤モデル設計と整合的だが、ここでは対象ロボットの監督なしで未来の全身動作を学ばせている点が焦点である。重要なのは、入力が映像だけでも動作だけでもなく、人間・3D・複数ロボットの異種データを「canonicalize」して単一空間に載せ替えていることだ。これは、ロボット専用の狭い実演データよりも、広く集めたモーションをどう整形するかが性能を左右するという設計思想を示す。本紙の過去記事との接続はないが、公開情報だけを見ても、学習のボトルネックが「何を見せるか」から「異なる身体の動きをどう共通表現に写像するか」へ移っていることが読み取れる。業界構造への含意としては、競争軸が単純なデータ量から、異種モーションの正規化手法、MoTのような統合アーキテクチャ、そして実機少量デモとの接続に移る可能性がある。とくに、Motion Expertがロボット監督なしで未来動作を予測し、その後にVideo ExpertとAction Expertへ接続される構造は、知覚・予測・行動の分業を再編する。未確定の論点は、UniMotion-4Kの具体的な内訳比率、対象としたヒューマノイドの範囲、実世界タスクでの失敗条件、そして限定的なデモ数の下で性能がどこまで維持されるかである。

なぜ重要か

4K時間超の異種モーションを単一空間にまとめ、少量の対象ロボット実演で実世界のヒューマノイド操作に転移する設計は、実機データ収集コストを抑えたい開発側に直接関係する。論文が示したのは、動作データの量だけでなく、身体差をまたぐ表現設計が性能とデータ効率を左右するという点である。

日本への影響

日本のヒューマノイド開発やモーション収集では、実機デモの量だけでなく、人間動画・3Dモーション・複数機体をまたぐ正規化の設計が論点になるとみられる。とくに、実機学習用の少量データを補うために、動作データを共通表現へ変換する工程を持てるかが焦点になる。