何が起きたか
研究チームは2026年5月7日、人間の身体活動を大規模に収録したビデオコーパス「HumanNet」を発表した。このデータセットは100万時間の人間中心ビデオで構成され、第一人称と第三人称の視点を含む。さらに、キャプションや動作記述、手や身体に関する信号などのインタラクション中心のアノテーションが付与されている。
詳細
HumanNetは、人間と物理世界とのインタラクションを大規模に捉えることを目的としたデータセットである。多様な実世界環境での細かい活動、人間と物体のインタラクション、道具使用、長期的行動をカバーする。データセットには、キャプション、動作記述、手や身体に関する信号など、インタラクション中心のアノテーションが含まれる。また、人間中心のフィルタリング、時間的構造化、視点の多様性、アノテーションの充実を第一級の設計原則とする体系的なデータキュレーションパラダイムを導入している。
Key Facts
| HumanNetは100万時間の人間中心ビデオコーパスであり、第一人称と第三人称の視点を含む。 | [1] |
| HumanNetは、細かい活動、人間と物体のインタラクション、道具使用、長期的行動をカバーする。 | [1] |
| HumanNetは、キャプション、動作記述、手や身体に関する信号などのインタラクション中心のアノテーションを提供する。 | [1] |
| 検証では、Qwen VLMモデルをHumanNetの1000時間の映像で継続学習した場合、Magic Cobotの100時間の実ロボットデータで継続学習した場合を上回る性能を示した。 | [1] |
| 研究チームは、人間中心のビデオがロボットデータのスケーラブルで費用対効果の高い代替手段になる可能性があるとしている。 | [1] |
本紙の見方
今回の発表は、身体知能の研究におけるデータ基盤の新たな方向性を示すものだ。従来、ロボットの学習には実ロボットデータが不可欠とされてきたが、HumanNetは人間のビデオデータを大規模に活用することで、その前提に挑戦している。特に、1000時間の人間ビデオが100時間の実ロボットデータを上回る性能を示した点は、データのスケーラビリティとコスト効率の観点から重要な意味を持つ。 本紙の過去報道との接続はないが、この結果は、身体知能の研究がロボット固有のデータに依存する段階から、人間の行動データを活用する段階へ移行しつつあることを示唆している。人間のビデオデータはインターネット上に豊富に存在し、実ロボットデータよりも収集が容易でコストが低い。そのため、このアプローチが確立されれば、身体知能の研究開発の速度と規模が飛躍的に向上する可能性がある。 業界構造への含意としては、データ供給の面で新たなエコシステムが生まれる可能性がある。従来はロボットメーカーや研究機関が実機を用いてデータを収集していたが、今後は一般のビデオデータを活用する企業や研究機関が競争優位を得るかもしれない。また、データの質と量がモデルの性能を左右するため、データキュレーションの技術やアノテーションの自動化が重要な競争領域になるだろう。 未確定の論点としては、HumanNetのデータが実際のロボット制御にどの程度転移可能か、また、より大規模なデータで学習した場合の性能向上の限界がどこにあるかが焦点になる。さらに、今回の検証は特定のモデルとタスクに限定されており、他のモデルやタスクでの汎用性はまだ不明である。今後の研究では、これらの点を検証する必要がある。
なぜ重要か
この研究は、身体知能の学習データの調達方法に変革をもたらす可能性がある。人間のビデオデータを活用することで、ロボットデータの収集コストと時間を大幅に削減できるかもしれない。また、データのスケーラビリティが向上すれば、身体知能の進歩が加速し、より高度なロボットの実現につながる可能性がある。