何が起きたか

2026年2月8日、arXivにプレプリント「Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models」が公開された。提案手法は、拡散ワールドモデルを用いた強化学習において、複数の未来観測を並列にデノイズするオン・ポリシー想像プロセスを導入し、計算効率を改善する。実験では、Atari 100KとCraftiumで、半分のデノイズステップ(サブフレーム予算)で制御性能を維持したとしている。

詳細

提案手法「Horizon Imagination (HI)」は、離散確率ポリシー向けのオン・ポリシー想像プロセスであり、複数の未来観測を並列にデノイズする。安定化メカニズムと、デノイズ予算と適用される有効ホライズンを分離する新しいサンプリングスケジュールを導入し、サブフレーム予算もサポートする。実験はAtari 100KとCraftiumで行われ、半分のデノイズステップで制御性能を維持し、様々なスケジュールで優れた生成品質を達成したと報告している。コードはGitHubで公開されている。

Key Facts

arXivにプレプリント「Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models」が公開された(2026年2月8日)。[1]
提案手法HIは、離散確率ポリシー向けのオン・ポリシー想像プロセスで、複数の未来観測を並列にデノイズする。[1]
HIは安定化メカニズムと、デノイズ予算と有効ホライズンを分離する新しいサンプリングスケジュールを導入し、サブフレーム予算をサポートする。[1]
Atari 100KとCraftiumでの実験で、半分のデノイズステップで制御性能を維持し、様々なスケジュールで優れた生成品質を達成したと報告している。[1]
コードはhttps://github.com/leor-c/horizon-imaginationで公開されている。[1]

本紙の見方

今回の発表は、拡散ワールドモデルを用いた強化学習における計算効率の課題に取り組むものである。拡散モデルは生成忠実度が高い一方、推論時の計算コストが高く、制御用途では逐次的な想像プロセスがボトルネックとなる。HIは、複数の未来観測を並列にデノイズすることで、この逐次性を緩和し、計算コストを削減する点が新規性である。特に、デノイズ予算と有効ホライズンを分離するサンプリングスケジュールは、サブフレーム予算を可能にし、計算資源の柔軟な配分を実現する。これは、実時間制御への応用を視野に入れた場合に重要な進展とみられる。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、拡散ワールドモデルの効率化は、ロボット制御やシミュレーション環境での意思決定において共通の課題であり、本手法はその一解決策として位置づけられる。 業界構造への含意としては、強化学習を用いた制御システムの開発において、計算資源の制約が実用化の障壁となることが多い。HIのような効率的な想像プロセスは、エッジデバイスやリアルタイムシステムへの展開を後押しする可能性がある。また、サブフレーム予算のサポートは、ハードウェアの性能に応じた調整を可能にし、導入の柔軟性を高める。 未確定の論点としては、提案手法が実際のロボット制御や大規模環境でどの程度スケールするか、また、生成品質の向上が具体的にどのようなタスクで有効かが挙げられる。さらに、コードが公開されているため、再現実験やベンチマーク比較が今後の焦点となるだろう。

なぜ重要か

拡散ワールドモデルの実用化には計算コストの削減が不可欠であり、本手法はその一歩となる。強化学習を実世界の制御問題に適用する際の障壁を低減する可能性があり、ロボティクスや自動運転などへの応用が期待される。