何が起きたか
研究チームは、ロボットの行動計画を高速化する世界モデル「DriftWorld」を発表した。arXivに2026年7月16日付で公開された論文(識別番号2607.15065v2)で報告された。DriftWorldは、拡散型生成モデルのように推論時に反復的なノイズ除去を行わず、訓練中にアクション条件付きドリフトを学習することで、現在の観測と候補アクション系列から未来フレームを単一フォワードパスで生成する。これにより30fps以上で動作し、拡散ベースのベースラインと比較して平均17倍高速であるとしている。
詳細
予測的世界モデルは、ロボットが行動の結果を想像することで計画を可能にするが、その制御への価値は多くのロールアウトを迅速に生成できるかどうかに依存する。拡散ベースの世界モデルでは、多段階サンプリングにより各ロールアウトのコストが高く、推論時の大規模な行動探索が制限されるというボトルネックがあった。DriftWorldはこの問題に対し、訓練中にアクション条件付きドリフトを学習することで対処する。 評価は、Bridge-V2、RT-1、Language Table、Push-T、Robomimicなどの標準的な視覚ベースのロボット操作ベンチマークで実施された。DriftWorldは、正確かつ高速なロールアウトを生成することで、拡散ベースのワールドモデルベースラインよりもはるかに少ない推論時間で最先端の意思決定性能を達成したとしている。 さらに、オンライン制御に加えて、DriftWorldはオフラインシミュレータとしても機能し、実世界のロボットポリシーのランキングに使用できる。ロールアウトベースのスコアは、最大0.99の相関でグラウンドトゥルースと相関した。これらの結果は、ドリフトモデルがロボットのワールドモデリングに強く適合することを示していると研究チームは述べている。
Key Facts
| DriftWorldは、アクション条件付き世界モデルであり、推論時に反復的なノイズ除去を行わず、単一フォワードパスで未来フレームを生成する。 | [1] |
| DriftWorldは30fps以上で動作し、拡散ベースのベースラインと比較して平均17倍高速である。 | [1] |
| 評価はBridge-V2、RT-1、Language Table、Push-T、Robomimicのベンチマークで実施された。 | [1] |
| DriftWorldは、拡散ベースのワールドモデルベースラインよりもはるかに少ない推論時間で最先端の意思決定性能を達成したとしている。 | [1] |
| DriftWorldはオフラインシミュレータとしても機能し、ロールアウトベースのスコアは最大0.99の相関でグラウンドトゥルースと相関した。 | [1] |
| 論文はarXivに2026年7月16日付で公開された(識別番号2607.15065v2)。 | [1] |
なぜ重要か
DriftWorldは、拡散モデルの推論コストというボトルネックを解消し、ロボットの行動計画を高速化する可能性を示す。単一フォワードパスでの生成により、大規模な行動探索が可能になり、実世界のポリシー評価にも応用できる。