何が起きたか

研究チームは2026年6月7日、一人称視点の人間デモから全身動作を学習するフレームワーク「EgoPriMo」を発表した。EgoPriMoは、一人称観測とテキストプロンプトからSMPL形式の全身動作を再構成・生成・予測する。実験では、NymeriaとEgoExo4Dのデータセットを用い、1つのチェックポイントで動作生成性能を既存手法のUniEgoMotionより向上させた。生成されたSMPL動作はUnitree製ヒューマノイドのコントローラで実行可能で、実機での応用が示された。

詳細

EgoPriMoは、身体ダイナミクス・一人称視覚コンテキスト・テキストを同時にモデル化するTriple-stream DiTを中核とする。言語は完全な動作仕様ではなく高レベルの制御信号として使用される。タスク条件付けマスクにより、異なるタスクや欠損モダリティのデータを同一チェックポイントで処理できる。実験では、NymeriaとEgoExo4Dのデータセットを使用し、動作生成タスクでUniEgoMotionを上回る性能を示した。さらに、生成されたSMPL動作はUnitree製ヒューマノイドのコントローラで実行可能であることが確認された。

Key Facts

EgoPriMoは、一人称視点の人間デモから全身動作を学習するフレームワークであり、テキストプロンプトに基づきSMPL形式の動作を再構成・生成・予測する。[1]
EgoPriMoの中核はTriple-stream DiTであり、身体ダイナミクス、一人称視覚コンテキスト、テキストを同時にモデル化する。[1]
実験ではNymeriaとEgoExo4Dのデータセットを使用し、1つのチェックポイントで動作生成性能がUniEgoMotionを上回った。[1]
生成されたSMPL動作はUnitree製ヒューマノイドのコントローラで実行可能である。[1]

本紙の見方

EgoPriMoの発表は、ヒューマノイドの動作生成におけるパラダイム転換を示唆する。従来の動作追跡は指定軌跡の再現に留まり、視覚言語行動モデルは意味的インターフェースを提供するが、広範な全身行動のためのスケーラブルでインタラクティブなプリヤーは存在しなかった。EgoPriMoは、一人称視点の人間デモから学習することで、このギャップを埋める。 本紙の過去報道との関連では、2026年6月11日のReuters分析がUnitreeの上場と中国ロボット産業の厳しい現実を指摘していた。EgoPriMoがUnitree製ヒューマノイドで実機実行可能であることは、Unitreeが研究コミュニティと連携し、ソフトウェア基盤の強化を図る動きの一環とみられる。また、2026年5月28日の韓国機械研究院のKAIROS開発は、中国製ロボットとの差別化を強調していたが、EgoPriMoのような研究は中国企業の技術力向上に寄与する可能性がある。 業界構造への含意として、EgoPriMoはデータ駆動型の動作生成を実現し、ヒューマノイドの開発におけるデータの重要性を再確認させる。一人称視点のデモデータは比較的取得しやすく、スケーラブルな学習が可能になる。これは、実世界データの収集と学習のループを加速させ、ヒューマノイドの汎用性向上に寄与する。 未確定の論点として、EgoPriMoが実際の製品に組み込まれるかどうか、またUnitree製ヒューマノイドでの実行がどの程度の精度で行われるかは、ソース本文には明記されていない。さらに、EgoPriMoの学習データの規模や計算資源の要件も不明である。今後の検証が待たれる。

なぜ重要か

EgoPriMoは、ヒューマノイドの動作生成をデータ駆動型でスケーラブルにする可能性を示す。Unitree製ヒューマノイドでの実行が確認されたことで、中国のロボット企業が研究コミュニティと連携し、ソフトウェア基盤を強化する動きが加速する可能性がある。