何が起きたか

arXivは2026-09-28、論文「WB-WAM: Heterogeneous Body-Hand Pre-training for Humanoid Loco-Manipulation」を掲載した。論文は、ヒューマノイドの全身移動と把持を扱うため、身体・体幹・器用な手指の注釈を統合するWorld Action Model「WB-WAM」を提案している。学習には、部分注釈付きの動画・動作データ1880.2時間を用いた。

詳細

WB-WAMは、異なる由来のデータにまたがる身体、根元、手指の注釈を、共通の物理的行動空間で結びつける設計だとしている。事前学習の後段ではPICO mid-trainingを行い、さらに補助的な順運動学の監督でロボット課題に適応させる。WB-Datasetsも構築し、リターゲティングした一人称視点の人間デモとロボット軌跡を含め、限られたロボットデータを補う構成としている。

Key Facts

arXivに「WB-WAM: Heterogeneous Body-Hand Pre-training for Humanoid Loco-Manipulation」が掲載された。[1]
WB-WAMは、身体・体幹・器用な手指の注釈を統合するWorld Action Modelである。[1]
学習データは、部分注釈付きの動画・動作データ1880.2時間である。[1]
評価では、シミュレーションのHumanoidArenaで81.9%を示した。[1]
実機実験では、5課題の平均成功率が84.0%だった。[1]

本紙の見方

WB-WAMの新規性は、ヒューマノイド向け学習を単なる視覚事前学習や個別動作模倣ではなく、身体・体幹・手指をまたぐ「全身の行動空間」としてまとめた点にある。1880.2時間というデータ量そのものも重要だが、より本質的なのは、異なる由来の部分注釈データを共通表現に載せ替え、そこからPICO mid-trainingと順運動学監督でロボット課題へ接続している構造である。入力となる人間の一人称デモ、処理としての中間学習、出力としてのロボット軌跡という流れが明確で、データ不足を補う設計として読める。 本紙の関連記事はないため、過去報道との連続性は置かないが、今回の論文は「ヒューマノイドの全身制御に必要なデータをどう集め、どう整形するか」を主題に置いている点で、モデル性能の話よりデータ構成の話が前面に出ている。HumanoidArena 81.9%と実機5課題平均84.0%は、少なくとも論文上はシミュレーションと現実の双方で全身タスクを検証したことを示すが、どの課題で何が苦手だったかまでは本文抜粋からは読めない。したがって、評価の解釈は成功率の高さだけで終えず、タスクの種類、失敗モード、データ削減効果の条件を見る必要がある。 業界構造への含意は、ヒューマノイドの競争軸が機体ハードだけでなく、全身の行動データをどう標準化し再利用するかに移っている点にある。WB-Datasetsのような構成は、人間デモとロボット軌跡を同一の学習系に載せるため、データ収集、注釈、リターゲティング、順運動学監督が一体の工程になる。今後の焦点は、1880.2時間の内訳、各データ源の比率、PICO mid-trainingでどの程度ロボット実演を削減できたのか、そして実機84.0%がどの条件で再現できるかである。

なぜ重要か

WB-WAMは、限られたロボット実演を補うために人間の全身デモをどう転用するかを示している。論文が示したのは、身体・体幹・手指を分けずに学習する枠組みが、シミュレーションと実機の双方で一定の成功率につながりうるという点である。

日本への影響

日本のロボット研究やヒューマノイド開発では、機体制御だけでなく全身データの収集・注釈・リターゲティングが重要になるとみられる。とくに、実機実演の削減を目指す設計は、限られた試験機会で学習データを増やしたい開発現場に関係する。