何が起きたか

Qwenチームは2026年6月16日、ロボット操作の基盤モデル「Qwen-RobotManip」に関するテクニカルレポートを公開した。同モデルはQwen-VLを基盤とし、表現・動作・行動の3次元にわたる統一的なアライメントフレームワークを導入することで、大規模なマルチソース学習を可能にしたとしている。約3万8100時間の事前学習コーパスを構築し、複数のOODベンチマークで従来の最先端モデルを上回ったと主張している。

詳細

Qwen-RobotManipは、ロボット操作のデータが本質的に異質で、収集コストが高く、多様性が狭いという課題に対処するため、表現・動作・行動の次元でデータを統一するアライメントフレームワークを導入した。人間からロボットへの合成パイプラインにより、15のプラットフォーム向けに手のデモをロボットの軌跡に変換する。オープンソースのデータセットと人間のビデオのみを使用し、独自のデータ収集を行わずに約3万8100時間の事前学習コーパスを構築した。評価では、RoboCasa365、LIBERO-Plus、EBench、RoboTwin-Clean2Rand、RoboTwin-IF、RoboTwin-XEなどのOOD設定を採用し、π0.5を含む従来の最先端モデルをすべてのOOD設定で大幅に上回ったとしている。RoboChallengeでは1位を獲得し、相対改善率20%を達成したと主張。実ロボットではAgileX ALOHA、Franka、UR、ARXで検証された。

Key Facts

Qwen-RobotManipはQwen-VLを基盤とするVision-Language-Action基盤モデルである。出典一覧
約3万8100時間の事前学習コーパスを構築した。出典一覧
人間からロボットへの合成パイプラインにより、15のプラットフォーム向けにデモを変換する。出典一覧
RoboChallengeで1位を獲得し、相対改善率20%を達成したとしている。出典一覧
実ロボットプラットフォームとしてAgileX ALOHA、Franka、UR、ARXで検証された。出典一覧

本紙の見方

今回の発表は、ロボット操作分野における基盤モデルのスケーリング手法を提示した点で新規性がある。言語やマルチモーダル分野で確立された「アライメントとスケール」のレシピをロボット操作に適用し、異種データを統一的な枠組みで扱うことで、大規模学習を可能にしたとしている。これは、データの不均一性が障壁となっていたロボット操作分野において、データの調和とスケールの両立を目指す試みとして位置づけられる。 本紙の過去報道との接続はないが、ロボット操作基盤モデルの競争が激化する中で、Qwenチームがオープンソースデータのみで大規模コーパスを構築した点は、データ収集のコスト構造に影響を与える可能性がある。従来は独自データ収集が性能の鍵とされてきたが、人間のデモ動画を合成パイプラインで変換する手法は、データ調達のハードルを下げる可能性がある。 一方で、評価に用いたOODベンチマークは標準的なものではなく、実世界での汎化性能がどこまで保証されるかは未確定である。また、約3万8100時間のコーパスの構成や、各データセットの寄与度、学習時の計算資源などは明らかにされておらず、再現性やスケールの限界を検証するには追加情報が必要となる。 業界構造への含意としては、ロボット操作モデルの性能競争が、データの質と量だけでなく、アライメント手法の優劣にシフトする可能性がある。また、オープンソースデータの活用が進めば、データエコシステムの整備が競争力を左右する要素になるだろう。

なぜ重要か

ロボット操作基盤モデルの開発において、オープンソースデータと合成パイプラインによる大規模学習が有効であることを示した点は、業界のデータ戦略に一石を投じる。今後の焦点は、このアプローチが実世界の多様な環境でどこまで汎化するか、そして他の研究機関が同様の手法を再現・発展させられるかにある。