何が起きたか

arXiv掲載の論文「Whole-Body UMI: Transferring UMI Manipulation Skills to Humanoid Whole-Body Manipulation via Real-Time Motion Generation」は2026-09-19に公開された。論文は、Universal Manipulation Interface(UMI)の操作スキルをヒューマノイドの全身操作へ移すための「Whole-Body UMI(WB-UMI)」を提案している。実機実験ではG1を使い、drawer closing、shelf pick-and-place、ball toss、Loco-PnPの4タスクでリアルタイム閉ループ転移を検証した。

詳細

論文によると、WB-UMIはタスク非依存のリアルタイム・エンドエフェクタ条件付き運動生成器であり、全身協調の学習とタスク意味論の学習を分離する設計である。native UMI demonstrationsからはdiffusion policyを学習し、WB-UMIはretargeted motion captureから独立に学習するため、タスク固有のデータ収集でbody trackersやpaired image--whole-body demonstrationsを必要としないとしている。 実機のリアルロボット実験ではG1上で4タスクを評価し、成功率はdrawer closing 90%、shelf pick-and-place 80%、ball toss 30%、Loco-PnP 40%だった。リアルデプロイメントでは、asynchronous hierarchyがdiffusion policy、motion generator、whole-body controllerを統合し、latency compensationとmeasured-state feedbackを組み合わせている。

Key Facts

Whole-Body UMI(WB-UMI)は、タスク非依存でリアルタイムのエンドエフェクタ条件付き運動生成器である。[1]
WB-UMIは、全身協調の学習とタスク意味論の学習を shared end-effector interface で分離する。[1]
WB-UMIは retargeted motion capture から独立に学習し、タスク固有のデータ収集で body trackers や paired image--whole-body demonstrations を必要としない。[1]
実機実験は G1 で行われ、drawer closing 90%、shelf pick-and-place 80%、ball toss 30%、Loco-PnP 40% の成功率を示した。[1]
実デプロイメントでは、asynchronous hierarchy が diffusion policy、motion generator、whole-body controller を latency compensation と measured-state feedback で統合した。[1]

本紙の見方

この論文の新規性は、ヒューマノイドの全身操作を「末端の軌道」だけでなく、全身協調の生成器として扱った点にある。UMIはもともとスケーラブルなデータ収集枠組みとして位置づけられているが、論文はそのままでは全身協調が不定になるとし、WB-UMIでその隙間を埋めた。つまり、既存のUMIを単にヒューマノイドへ移植したのではなく、エンドエフェクタ条件の運動生成と全身制御を分けて再構成したところに焦点がある。 本紙の関連記事はないため、過去報道との連続性は置けない。ただし、論文本文だけでも、データ収集の単位が「全身デモ」そのものから、native UMI demonstrationsとretargeted motion captureの二系統へ分かれている点は重要である。これは、遠隔操作による全身デモ収集のコストという既存課題に対し、タスク固有の人手収集を減らす方向へ設計を寄せたものと読める。一方で、ball tossが30%、Loco-PnPが40%にとどまっており、動作の種類によって転移の難度が異なることも示唆される。 業界構造への含意としては、論点が「ロボット本体の性能」だけでなく、「どの形式のデモをどう再利用できるか」というデータ基盤側に移っている。特に、body trackersやpaired image--whole-body demonstrationsを不要にする設計は、全身データ取得の装置構成と収集手順を簡素化する可能性がある。ただし、実験はG1上の4タスクに限られており、他機種への一般化、タスク数の拡張、稼働時の安定性、latency compensationの条件依存性はまだ確認が必要だ。あわせて、retargeted motion captureの品質が最終性能にどう効くかも未確定の論点である。

なぜ重要か

論文は、ヒューマノイド全身操作の学習を、遠隔操作での全身デモ収集に全面依存しない形へ寄せた点に意味がある。body trackersやpaired image--whole-body demonstrationsを必要としないとしたことで、データ取得の手順を簡略化できる可能性がある。実機ではG1で4タスクの成功率が示されており、少なくとも一部の操作ではリアルタイム閉ループ転移が機能することを示した。

日本への影響

日本にとっては、ヒューマノイドの実機制御だけでなく、retargeted motion captureや全身デモの収集基盤をどう設計するかが論点になるとみられる。body trackersやpaired image--whole-body demonstrationsを要しない構成は、実験設備やデータ収集手順の負担を下げる可能性があるが、G1で示された4タスクの結果をそのまま日本の機種に当てはめることはできない。