何が起きたか
arXivは2026年8月27日、論文「CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators」を公開した。論文は、人間とロボットの多様な動画を使って学習するcross-embodimentのaction-conditioned video generationを提案し、単一のロボット形態に限られがちな既存のvideo world modelの制約を超えることを狙うものだ。著者らは、異なる行動空間をend-effector poses、language instructions、latent actionsでそろえると説明している。
詳細
CLAPはまず、ラベルなしの大規模動画からlatent actionsを用いて基礎的な物理的事前知識を学び、その後にend-effector action spaceへ接続して実世界の課題へzero-shotで適用する段階的な学習法を採るとしている。論文は、DROIDのような難しい環境でsingle-embodimentのvideo modelに匹敵または上回る性能を示し、few-shot adaptationによってその差がさらに拡大すると述べる。 また、CLAPはcross-embodiment、DROID、Bridge、bimanual YAM robots、G1 humanoidsまで含む、異なるaction-conditioning spaceとrobot morphologiesをまたぐ最も包括的なaction-conditioned video world modelsの組み合わせを提供すると主張している。コードとモデルはオープンソースとして公開された。
Key Facts
| 論文名は「CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators」である。 | [1] |
| 掲載日は2026-08-27で、媒体はarxiv.orgである。 | [1] |
| CLAPはcross-embodimentのaction-conditioned video generationを提案している。 | [1] |
| 行動空間の統合にend-effector poses、language instructions、latent actionsを用いるとしている。 | [1] |
| コードとモデルをopen-sourceとして公開したとしている。 | [1] |
本紙の見方
CLAPの新しさは、単一のロボット身体に閉じた動画世界モデルを、人間と複数ロボットの動画へ広げようとしている点にある。既存のaction-conditioned video modelが単一embodiment前提であるという制約に対し、CLAPはend-effector poses、language instructions、latent actionsを同じ学習枠組みに入れ、身体差の大きい動画をまたぐ設計を前面に出した。一方で、段階的学習そのものは既存の自己教師あり学習や事前学習の延長線上にも見えるため、完全な新理論というより、異なる表現を束ねる実装上の整理として読むのが妥当である。 本紙の観点では、重要なのは「動画から物理を学ぶ」対象が、単一ロボットの操作ログではなく、インターネット規模の異種動画へ広がっている点である。これにより、ロボットごとの行動表現の違いをどう埋めるかが中心論点になり、モデル精度だけでなく、行動表現の共通化方法そのものが競争軸になるとみられる。論文がDROID、Bridge、bimanual YAM robots、G1 humanoidsまで例示していることは、用途や形態の違うデータを一つの学習設計に載せる意図を示すが、実運用でどの範囲まで一般化するかはまだ限定的だろう。 また、zero-shot physical simulatorsという位置づけは、実機導入の前段での検証手段としての含意がある。ただし、論文が主張するのは性能優位であって、現場での安全性や失敗率、長期運用の安定性までは示していない。次に確認すべきは、どの程度のタスクでzero-shot性能が維持されるか、few-shot adaptationが何例で成立するか、そしてend-effector、language、latentの3系統を併用したときのBOMに相当する学習コストやデータ要件がどこにあるかである。
なぜ重要か
人間と複数ロボットの動画をまたぐ学習枠組みを論文が示したことで、単一ロボット専用の世界モデルに依存しない評価軸が生まれる。研究開発側にとっては、end-effector posesやlanguage instructionsだけでなくlatent actionsまで含めた表現統合が、zero-shot適用の前提条件になる。
日本への影響
日本のロボット研究や製造現場で使う場合も、単一機種向けの動画モデルではなく、複数形態のロボットをまたぐ表現統合が課題になるとみられる。特に、G1 humanoidsのようなヒューマノイドと、bimanual YAM robotsのような双腕機を同列に扱う設計は、機種ごとに学習データを分断してきた開発体制に見直しを迫る可能性がある。