日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
データ生成/VLAarXiv:2608.02580v1

Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

シェア:XThreadsFacebookLINEはてブBluesky

自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データでVLAモデルの汎化性能を向上させた。

詳しい要約

1. どんなもの?

Ego2Robotは、人間の一人称視点(egocentric)の操作ビデオを、ロボットの訓練データに変換するスケーラブルなパイプラインを提案する。アクションのリターゲティング、ロボットアームの視覚合成、多段階の品質キュレーションを通じて、15種類のロボット形態に対応する18,561時間のロボット訓練データを生成する。これは、これまでで最大のego-to-robotデータセットであり、大規模な視覚言語行動モデル(VLA)の事前学習に利用できる。

2. 先行研究と比べてどこがすごい?

先行研究では、egocentricビデオをロボットデータに変換する手法が小規模なタスクごとのポリシー学習に有効であることが示されていたが、大規模な事前学習への応用は未検討だった。Ego2Robotは、スケーラブルなパイプラインを構築し、大規模データセットを生成することで、VLAモデルの事前学習に有効であることを示した点が新しい。また、多様なロボット形態とタスクをカバーし、一般化性能を評価するためのベンチマーク(RoboTwin2.0の拡張)も提供する。

3. 技術・手法の肝は?

手法の核は、①アクションリターゲティング(人間の手の動きをロボットの動作に変換)、②ロボットアームの視覚合成(人間の腕をロボットアームに置き換えた画像を生成)、③多段階の品質キュレーション(データの品質をフィルタリング)の3つのステップからなるパイプライン。これにより、キュレーションされたデータセットとin-the-wildビデオの両方を処理できる。さらに、一般化評価のためのRoboTwin2.0拡張では、視覚的外観、シーン配置、身体形態、タスク意味論の4つの摂動軸を導入している。

4. どうやって有効だと検証した?

有効性の検証は、RoboTwin2.0を拡張したベンチマークを用いて、Ego2Robotで合成したデータと実ロボットデータを併用した事前学習が、複数の摂動タイプに対するout-of-distribution一般化を一貫して向上させることを実験で示した。さらに、実ロボットへの展開でも有効性を確認している。

5. 議論はある?

要旨からは、データ合成の品質や多様性の限界、実ロボット展開での具体的な性能差、計算コストなどに関する議論は不明。また、合成データと実データの比率や、異なるロボット形態間の転移可能性についての詳細な分析は要旨に含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、RoboTwin2.0(ベンチマークの基盤)や、egocentricビデオからのリターゲティング手法(先行研究)が挙げられる。また、VLAモデルの事前学習に関する一般的な研究(例:OpenVLA、RT-2など)も関連するが、要旨では明示されていないため、同分野の定番として挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

分類: cs.RO

原文アブストラクト

Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has shown that retargeting and rendering such videos into robot-format data can yield effective per-task policies at small scale. However, whether this approach can provide pretraining benefits for vision-language-action models at scale remains unexplored. We present \textbf{Ego2Robot}, a scalable pipeline that converts egocentric human manipulation videos into robot training data through action retargeting, robot-arm visual synthesis, and multi-level quality curation. Ego2Robot supports both curated datasets and in-the-wild videos, producing 18,561 hours of robot training data spanning 15 robot morphologies, making it the largest ego-to-robot dataset to date. To evaluate generalization, we extend RoboTwin2.0 with disentangled perturbation axes covering visual appearance, scene layout, embodiment morphology, and task semantics. Experiments show that joint pretraining on Ego2Robot-synthesized and robot data consistently improves out-of-distribution generalization across multiple perturbation types, with benefits validated on real-robot deployment. Project page: https://www-ye.github.io/ego2robot_blog/