何が起きたか

研究チームは2026年8月22日、ロボット操作のための世界モデル「DELE-w0.5」を発表した。この手法は、動画生成を介さずに、予測された将来の潜在状態からロボットの行動を直接推論する。実ロボット480回の試行で、4つの長期的操作タスクにおいて、成功率62.5%、マクロ段階的進捗81.3%を達成し、最強のベースラインをそれぞれ47.5ポイント、30.7ポイント上回った。

詳細

DELE-w0.5は、ビデオ生成バックボーン上に構築される従来のWorld-Action Models (WAMs)とは異なり、密な将来の視覚軌跡とロボット行動を共同で予測する代わりに、コンパクトな将来の潜在状態から行動系列を推論する。この将来の潜在状態は、ロボット操作の行動関連の物理的結果を捉え、世界モデリングと行動生成の間の明示的な橋渡しとして機能する。研究チームは、動画生成は世界モデリングにとって不要な中間目的であり、中間フレームは物理的状態間の視覚的遷移を記述するだけで、モデル容量と計算を消費すると主張している。DELE-w0.5は、物理世界がロボットの行動によってどのように変化するかをモデル化し、高次元の視覚的冗長性を除去することで、より安価なトレーニングと低遅延の推論を可能にする。

Key Facts

DELE-w0.5は、動画生成を介さずに、予測された将来の潜在状態からロボットの行動を推論する。[1]
実ロボット480回の試行で、4つの長期的操作タスクにおいて成功率62.5%、マクロ段階的進捗81.3%を達成。[1]
最強のベースラインを成功率で47.5ポイント、段階的進捗で30.7ポイント上回った。[1]
DELE-w0.5は、将来の潜在状態が行動関連の物理的結果を捉え、世界モデリングと行動生成の橋渡しとなるとする。[1]
動画生成は不要な中間目的であり、中間フレームは物理的状態間の視覚的遷移を記述するだけだと主張。[1]

本紙の見方

今回の提案は、ロボット操作における世界モデルの設計思想を転換するものだ。従来のWAMsは、ビデオ生成バックボーン上に構築され、密な将来の視覚軌跡とロボット行動を共同で予測する。しかし、研究チームは、動画生成は世界モデリングにとって不要な中間目的であり、中間フレームは物理的状態間の視覚的遷移を記述するだけで、モデル容量と計算を消費すると指摘する。この批判は、視覚的冗長性を排除し、行動の物理的結果に直接焦点を当てることで、より効率的な学習と推論を可能にするという点で、説得力がある。 本手法の核心は、将来の潜在状態を行動生成の明示的な橋渡しとして用いる点にある。これにより、世界モデルは「世界がどのように見えるか」ではなく「世界がどのように変化するか」をモデル化する。この設計は、ロボット操作の目標が物理的状態の変化を実現することであるという洞察に基づいており、視覚的詳細の再現にリソースを割くことを避ける。 業界構造への含意として、このアプローチは、ロボット操作の学習における計算コストと推論遅延の削減に寄与する可能性がある。特に、実ロボットでの試行回数が480回と比較的少ない中で、高い成功率を達成している点は、データ効率の向上を示唆する。これは、実世界でのデータ収集が高コストであるロボット工学の分野において、重要な進展と言える。 未確定の論点としては、提案手法が他のタスクや環境でどの程度汎化するか、また、より複雑な操作タスクでのスケーラビリティが不明である。さらに、将来の潜在状態の表現方法が、タスクの複雑さに応じてどのように設計されるべきかも今後の課題である。

なぜ重要か

この研究は、ロボット操作における世界モデルの設計を根本から見直し、動画生成という計算コストの高い中間目的を排除することで、より効率的で低遅延なロボット制御を実現する可能性を示した。実ロボットでの高い成功率は、このアプローチが実世界のタスクに適用可能であることを示しており、今後のロボット学習の方向性に影響を与えるだろう。