何が起きたか
arxiv.orgに2026-10-06付で掲載された論文「Workhorse: Learning Robust Whole-Body Humanoid Loco-Manipulation from Human Data」は、Unitree G1上で全身の接触を伴う操作を学習する手法を示した。論文は、ロボットを使わない人間デモから学び、胴体・両手首・両足の姿勢を含む5リンク目標を視覚プランナが予測し、強化学習ベースの全身トラッカーがロボット側で追従するとしている。実機では、箱の仕分け、投げられた箱の捕捉、スーツケースの押し倒しとよじ登りを行った。
詳細
論文では、2つの方策を同じ記録済み人間姿勢で別々に学習させ、リターゲティングを使わない構成を採っている。また、各方策の学習データを拡張し、もう一方が実行時に示す誤差を模倣するようにしている。 評価では、示範室のシミュレーション複製環境で箱仕分けが77%のエピソードで完了し、40 N.sの押し込み条件下では64%だった。両方策を同じデモから再学習した別のシミュレーション人型ロボットは、押し込みなしで83%のエピソードで箱仕分けを完了した。
Key Facts
| 論文名は「Workhorse: Learning Robust Whole-Body Humanoid Loco-Manipulation from Human Data」である。 | [1] |
| 掲載日は2026-10-06で、媒体はarxiv.orgである。 | [1] |
| 対象ロボットはUnitree G1である。 | [1] |
| 手法は、胴体・両手首・両足の姿勢を含む5リンク目標を視覚プランナが予測し、強化学習ベースの全身トラッカーが追従する構成である。 | [1] |
| シミュレーションの示範室複製環境で、箱仕分けは77%のエピソードで成功し、40 N.sの押し込み下では64%だった。 | [1] |
本紙の見方
この論文の新しさは、Unitree G1という実機上で、人のデモから直接学ぶ全身ロコマニピュレーションの分割学習を示した点にある。視覚プランナが5リンク目標を出し、別の全身トラッカーがそれを追う二段構えは、手先中心の操作学習ではなく、胴体・両手首・両足を同時に扱う設計である。一方で、学習素材はロボットのない人間姿勢であり、リターゲティングを使わない点は既存の人間デモ活用の延長にある。論文が同じデモ集合を使って両方策を個別に学習させ、さらに相手方の実行誤差を模倣するようデータ拡張していることから、単純な模倣学習ではなく、計画と追従のずれを前提にした設計を狙っているとみられる。 本紙の関連記事との接続でみると、Figure AI、F.02を溶解処分と報道 BMW工場で11カ月稼働が示したのは実機稼働後の機体評価であり、松延動力、智元機器人、宇樹科技が相次ぎ具身智能モデルを公表はモデル発表の競争を伝えていた。今回のWorkhorseは、その中間にある「モデルをどう機体で崩れずに動かすか」の層を扱っている。つまり、発表の中心は機体の世代差ではなく、デモ収集、計画、追従、回復をつなぐ制御スタックに移っている。実機で箱の取り落としや人の押し込み後の回復まで示した点は、実験室内の成功率だけでなく、外乱を含む実装の耐性が論点になっていることを示す。 業界構造への含意としては、まずデータの取り方が重要になる。遠隔操作やタスク別の手作業ラベルではなく、人間姿勢の記録から学ぶ構成は、学習用データの取得コストと再利用の仕方を変える可能性がある。次に、評価指標も単純な成功率だけでは足りず、40 N.sの押し込みのような外乱条件でどこまで維持できるかが比較軸になりうる。さらに、5リンク目標を出す計画層と全身トラッカー層を分ける構造は、機体差を吸収する前段と、機体に合わせて追従する後段の分業を示しており、ハードと学習器の境界設計が焦点になるとみられる。 未確定の論点は、実機での評価台数、学習に使った人間デモの規模、Unitree G1以外への再現性、実環境での連続稼働時間、そして箱仕分け以外のタスクで同じ構成がどこまで通用するかである。論文は示範室の複製シミュレーションを示したが、倉庫や工場のような環境にそのまま拡張できるかはまだ確認が必要だとみられる。
なぜ重要か
Unitree G1で箱仕分けやスーツケース操作まで示したことで、全身制御を伴う人型ロボットが、手先操作だけでなく移動・保持・回復を一体で扱う段階にあることが示された。発表元はarxiv.org掲載の論文であり、評価はシミュレーションの成功率と外乱条件を伴うため、実機適用では同じ手法がどの程度維持されるかが焦点になる。