何が起きたか
研究チームは2026年8月26日、人間の動画を文脈内指示として用いるロボット操作モデル「Zero-WAM」を発表した。RoboTwin 2.0シミュレーションの未学習7タスクで平均成功率47.0%を達成し、既存の最強の動画行動ベースラインを29.5ポイント上回った。実世界評価では、複数物体シーンや長期的操作、精密な挿入を含む未学習タスク構成への一般化を確認した。
詳細
Zero-WAMは、因果的なビデオ行動モデルであり、文脈内の人間の動画指示に従って未学習タスクを実行する。人間とロボットのペアデータ不足に対処するため、タスクサンプリングされたロボット軌道を意味的に一致する人間の動画に変換する自動パイプラインを提案し、8.6Kタスクにわたる74.2K組の人間-ロボットの文脈内学習ペアからなるデータセット「HumanGen」を構築した。モデル学習では、既知タスクから学習される近道を抑制し、動画プロンプトからタスク情報を抽出することを強制する「文脈内未来チャンク予測(IFP)」目的を導入した。
Key Facts
| Zero-WAMは、RoboTwin 2.0シミュレーションの未学習7タスクで平均成功率47.0%を達成し、最強の動画行動ベースラインを29.5ポイント上回った。 | [1] |
| HumanGenデータセットは、8.6Kタスクにわたる74.2K組の人間-ロボットの文脈内学習ペアで構成される。 | [1] |
| Zero-WAMは、因果的なビデオ行動モデルであり、文脈内の人間の動画指示に従って未学習タスクを実行する。 | [1] |
| 自動パイプラインは、タスクサンプリングされたロボット軌道を意味的に一致する人間の動画に変換する。 | [1] |
| 文脈内未来チャンク予測(IFP)目的は、既知タスクから学習される近道を抑制し、動画プロンプトからタスク情報を抽出することを強制する。 | [1] |
本紙の見方
今回の発表は、ロボット操作におけるゼロショットのクロスタスク一般化を、大規模言語モデルの文脈内学習(ICL)の枠組みに乗せた点で新規性が高い。従来のロボット学習は、タスクごとのデータ収集と再学習が前提であり、未学習タスクへの対応は困難だった。Zero-WAMは、人間の動画をタスク指定の手段として用いることで、パラメータ更新なしに新規タスクを実行することを目指しており、これはロボット学習のパラダイム転換といえる。 本稿の関連記事は存在しないが、ロボット学習分野の既存研究と比較すると、従来の模倣学習や強化学習はタスク固有の報酬設計やデータ収集に依存しており、Zero-WAMのアプローチはタスク指定を動画に委ねることで、その依存を軽減する。特に、人間の動画を指示として用いる点は、言語指示よりもリッチな視覚的手がかりを提供し、タスクの意図をより正確に伝達できる可能性がある。 業界構造への含意として、この技術はロボットの実用化における「タスク追加のコスト」を大幅に下げる可能性がある。現在の産業用ロボットは、新しいタスクを導入するたびに専門家によるプログラミングやデータ収集が必要であり、これが導入の障壁となっている。Zero-WAMのようなアプローチが実用化されれば、ユーザーは動画を提示するだけでロボットに新タスクを教示できるようになり、ロボットの柔軟性が飛躍的に向上する。また、HumanGenのような自動データ生成パイプラインは、人間とロボットのペアデータの不足という根本的な問題に対処するものであり、データ収集の効率化にも寄与する。 未確定の論点としては、シミュレーションでの成功率47.0%が実世界でどの程度の性能になるかが挙げられる。実世界評価では未学習タスク構成への一般化が確認されたが、成功率の数値は示されていない。また、HumanGenのデータ生成パイプラインが実際の人間の動画とどの程度意味的に一致しているか、IFP目的が近道学習をどの程度抑制できているかも、今後の検証が必要である。さらに、Zero-WAMのスケーラビリティ、すなわちタスク数やデータ量を増やした際の性能向上の度合いも不明である。
なぜ重要か
Zero-WAMは、ロボット操作におけるゼロショットのクロスタスク一般化を、人間の動画を文脈内指示として用いることで実現した。これは、ロボットのタスク教示コストを大幅に削減し、柔軟な自動化への道を開く可能性がある。また、自動データ生成パイプラインは、ロボット学習のデータ不足問題に対する実用的な解決策を示している。