何が起きたか
研究チームは2026年8月27日、クロスエンボディメント対応の行動条件付き動画生成フレームワーク「CLAP」を発表した。CLAPは、人間とロボットを含む多様なインターネット規模の動画データで学習可能で、エンドエフェクタのポーズ、言語指示、潜在行動を組み合わせて異なる行動空間を統合する。DROIDなどの環境で、単一エンボディメント向けの最先端動画モデルに匹敵またはそれを上回る性能を示したとしている。
詳細
CLAPは、異なるロボットプラットフォーム間で行動表現が大きく異なり、人間の動画には行動ラベルが存在しないという課題に対処するため、(1)エンドエフェクタのポーズ、言語指示、潜在行動を用いた行動空間の統合、(2)カリキュラムベースのクロスエンボディメント学習手法を導入した。この手法は、まずラベルなし動画データで潜在行動を用いて基礎的な物理的先行知識を学習し、その後エンドエフェクタの行動空間に接地することで、実世界タスクへのゼロショット展開を可能にする。CLAPは、DROID、Bridge、双腕YAMロボット、G1ヒューマノイドなど、多様なロボット形態と行動条件付け空間(エンドエフェクタ、言語、潜在)をカバーする。コードとモデルはオープンソースとして公開され、プロジェクトウェブサイトは https://omni-clap.github.io 。
Key Facts
| CLAPは、人間とロボットのエージェントにわたる多様なインターネット規模の動画データで学習可能な、クロスエンボディメント対応の行動条件付き動画生成フレームワークである。 | [1] |
| CLAPは、エンドエフェクタのポーズ、言語指示、潜在行動を用いて異なる行動空間を統合する。 | [1] |
| CLAPは、カリキュラムベースのクロスエンボディメント学習手法を導入し、まずラベルなし動画データで潜在行動を用いて物理的先行知識を学習し、その後エンドエフェクタの行動空間に接地する。 | [1] |
| CLAPは、DROIDなどの困難な環境で、単一エンボディメント向けの最先端動画モデルに匹敵またはそれを上回る性能を示した。 | [1] |
| CLAPは、コードとモデルをオープンソースとして公開している。 | [1] |
本紙の見方
CLAPの発表は、ロボット学習における動画世界モデルの設計思想に一つの転換を示す。従来の行動条件付き動画モデルは単一のロボット形態に制約され、異種の動画データを活用できなかった。CLAPは、物理法則がエージェントの形態に依存しないという洞察に基づき、人間とロボットの動画を横断的に学習する枠組みを提案する。このアプローチの新規性は、行動表現の違いを潜在行動とエンドエフェクタのポーズ、言語指示の組み合わせで橋渡しし、カリキュラム学習によってゼロショット展開を可能にした点にある。 本稿は過去の関連記事を持たないため、連続性の分析はできないが、ロボット基盤モデルの分野では、大規模データを活用した汎用物理シミュレータの構築が競争領域となっている。CLAPは、単一エンボディメントのモデルを凌駕する性能をDROIDで示したと主張しており、これはデータ効率と汎化の両面で優位性を主張するものだ。 業界構造への含意として、CLAPのようなクロスエンボディメント学習は、ロボットメーカー各社が独自に収集してきたデータを、共通の物理シミュレータの学習に活用できる可能性を示す。これにより、データの価値が再定義され、異なるロボット間での知識転移が容易になる。また、オープンソース公開により、研究コミュニティ全体の進捗を加速させる効果が期待される。 一方、未確定の論点も残る。CLAPが実際にどの程度のロボット形態でゼロショット性能を発揮するのか、DROID以外の環境での性能は不明である。また、潜在行動の学習がどの程度のデータ量を必要とするのか、実世界でのロバスト性は検証されていない。さらに、動画生成モデルとしての計算コストや推論速度も実用化には重要な要素だが、論文では明らかにされていない。
なぜ重要か
CLAPは、ロボット学習のデータ活用の壁を低くする可能性がある。異なるロボット間で物理的知識を共有できれば、個々のロボットのデータ不足を補い、実世界での適応を加速できる。これは、ロボットの汎用性向上に向けた重要な一歩となる。