何が起きたか

DreamX-Phi 1.0は、ロボット操作のためのアクション条件付きビデオワールドモデルであり、観測フレームと言語指示、エンドエフェクタのポーズとグリッパ状態からなる行動シーケンスを入力として、将来の観測を予測する。同モデルは、アームの同一性と剛体運動構造を保つため、PRoPEスタイルの幾何学的エンコーディングを注意機構に注入し、深度ブランチとSAM3マスク、凍結したV-JEPA教師を用いて物体の一貫性を維持する。さらに、分布マッチング蒸留により多段階生成器を数段階の学生モデルに蒸留し、効率的な展開を実現する。

詳細

DreamX-Phi 1.0は、観測フレーム、言語指示、およびエンドエフェクタのポーズとグリッパ状態からなる行動シーケンスを入力として、将来の観測を予測する。しかし、リアリズムだけでは忠実性は保証されず、説得力のあるロールアウトでも誤ったアームを動かしたり、操作対象の物体を失う可能性がある。そこで、各アームの指令経路を尊重するため、PRoPEスタイルの幾何学的エンコーディングを注意機構に注入し、アームの同一性と剛体運動構造を保持する。 行動制御だけではシーン全体の幾何学や小さな操作対象の進化を完全に制約できないため、シーンレベルの幾何学のための軽量な深度ブランチを追加し、把持中の物体の一貫性を維持するためにSAM3マスクと凍結したV-JEPA教師を使用する。さらに、多段階生成器を分布マッチング蒸留により数段階の学生モデルに蒸留し、効率的な展開を実現する。 執筆時点で、DreamX-Phi 1.0はWorldArena 2.0 ChallengeのTrack 1で1位、Track 2で2位を獲得している。モデルとコードは公開される予定である。

Key Facts

DreamX-Phi 1.0は、観測フレーム、言語指示、エンドエフェクタのポーズとグリッパ状態からなる行動シーケンスを入力として、将来の観測を予測するアクション条件付きビデオワールドモデルである。[0]
PRoPEスタイルの幾何学的エンコーディングを注意機構に注入し、アームの同一性と剛体運動構造を保持する。[0]
シーンレベルの幾何学のための軽量な深度ブランチを追加し、SAM3マスクと凍結したV-JEPA教師を使用して物体の一貫性を維持する。[0]
多段階生成器を分布マッチング蒸留により数段階の学生モデルに蒸留し、効率的な展開を実現する。[0]
WorldArena 2.0 ChallengeのTrack 1で1位、Track 2で2位を獲得した。[0]
モデルとコードは公開される予定である。[0]

なぜ重要か

このモデルは、ロボット操作におけるビデオワールドモデルの精度と忠実性を向上させるものであり、特にアームの同一性と物体の一貫性を保つための幾何学的エンコーディングと深度ブランチの導入は、今後の研究に影響を与える可能性がある。また、WorldArena 2.0 Challengeでの上位入賞は、その性能の高さを示している。