日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
両腕操作/VLA/データセットarXiv:2609.03591v1

1500時間のデモからオン方針修正までの両腕家庭操作のスケーリング

Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections

シェア:XThreadsFacebookLINEはてブBluesky

家庭内両腕操作タスクの1500時間のデモデータセットを公開し、VLAモデルXR-2を訓練。データ量とDAgger修正データの増加に伴い成功率が向上するスケーリング傾向を実証した。

詳しい要約

1. どんなもの?

本論文は、両腕ロボットによる家庭内操作タスクの汎用ポリシー学習を大規模データで実証した研究である。1,500時間に及ぶ多様な両腕操作のデモンストレーションデータセットを公開し、そのデータを用いてVision-Language-Action (VLA)モデルであるXR-2を訓練した。XR-2は、高スループットなデータパイプラインと多段階の訓練パラダイムにより、高い操作性能と訓練効率・データ利用効率を達成している。さらに、専門家デモデータ量の変化と、実時間の人間介入によるDAgger修正データを用いたポスト訓練という2つのスケーリング軸を調査し、タスク成功率がデータ量に対して一貫して向上するスケーリング傾向を示した。データセットはオープンソース化され、再現可能な研究を支援する。

2. 先行研究と比べてどこがすごい?

先行研究では、両腕操作の汎用ポリシー学習は高品質な大規模人間デモデータの不足がボトルネックとなっていた。本論文は、1,500時間という大規模かつ多様な両腕操作デモデータセットを新たに公開し、これを活用してVLAモデルXR-2を訓練した点が革新的である。また、データパイプラインと多段階訓練により、従来の手法に比べて訓練効率とデータ利用効率を高めつつ、強い操作性能を達成している。さらに、デモデータ量とDAgger修正データの両方でスケーリング傾向を系統的に検証した点も新規性が高い。

3. 技術・手法の肝は?

技術の肝は、大規模データ収集のための高スループットデータパイプラインと、多段階訓練パラダイムにある。具体的には、1,500時間のデモデータを効率的に収集・処理し、VLAモデルXR-2を訓練する。訓練は複数段階に分けられ、まず大規模なデモデータで事前学習し、その後、実時間の人間介入によるDAgger修正データでポスト訓練を行う。これにより、データ量の増加に伴う成功率のスケーリングを実現している。

4. どうやって有効だと検証した?

系統的な実験により、XR-2の操作性能を評価した。具体的には、専門家デモデータの量を変化させた場合と、DAgger修正データによるポスト訓練を行った場合の2つの設定で、タスク成功率を測定した。その結果、両設定ともデータ量の増加に伴い成功率が着実に向上し、現在のデータ規模において明確で一貫したスケーリング傾向を示すことを確認した。

5. 議論はある?

要旨からは、データ収集のコストや多様性の限界、実環境でのロバスト性、他のタスクやロボットへの一般化などに関する議論は不明である。また、スケーリング傾向がさらに大規模なデータでも続くかどうかは未検証であり、今後の課題と考えられる。

6. 次に読むべき論文は?

要旨で参照されている関連手法として、DAgger (Dataset Aggregation) が挙げられる。また、VLAモデルや両腕操作学習の分野では、RT-2やOpen X-Embodimentなどの関連研究が考えられるが、要旨に明記されていないため、一般名としてVision-Language-Action (VLA)モデル、Bimanual Manipulation、Imitation Learning、DAggerを挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiafeng Xu, Qi Li, Yan Shen, Yiyu Ren, Travis Davies, Shaowen He, Ze Wang, Yifan Yang, Ran Cheng, Hao Dong

分類: cs.RO

原文アブストラクト

Learning generalist policies for robust bimanual manipulation is bottlenecked by the scarcity of high quality large scale human demonstration data. In this work, we release 1,500 hours of diverse bimanual manipulation demonstrations covering everyday household tasks, and use this comprehensive corpus to train XR-2, a powerful vision-language-action (VLA) model. Enabled by a purpose built high throughput data pipeline and a carefully designed multi stage training paradigm, XR-2 attains strong manipulation performance in our systematic experiments while retaining favorable training efficiency and high data utilization. We further study two critical scaling axes: varying the amount of expert demonstration data, and post training on DAgger correction data from real time human interventions. In both settings, task success rate improves steadily over the data ranges we probe, exhibiting a clear consistent scaling trend at our current data scale. These results validate both the learning capacity of XR-2 and the promising scaling properties of the released dataset, which we open source to support reproducible research on bimanual robot manipulation learning.