何が起きたか

arxiv.orgに2026年6月25日付で掲載された論文『Hallucination in World Models is Predictable and Preventable』において、研究チームは世界モデルの幻覚がデータ被覆問題に起因するとの仮説を検証した。427時間・210タスクのデータセットMMBench2を導入し、350Mパラメータの世界モデルを訓練した。その結果、幻覚を3つのモードに分類し、それぞれを予測する信号を開発した。

詳細

研究チームは、幻覚が状態・行動空間の低被覆領域に集中するという仮説を立て、これを検証するためにMMBench2を構築した。MMBench2は427時間・210タスクのデータセットで、グラウンドトゥルースの行動・報酬・ライブシミュレータを含む。350Mパラメータの世界モデルを訓練し、知覚的幻覚、行動周縁化幻覚、シーン乖離幻覚の3つのモードを特定した。訓練時の被覆ギャップを埋めるため被覆認識サンプリングを開発し、オンラインでは幻覚予測器を好奇心報酬として使用し、未見環境への適応をわずか50の実環境トラジェクトリで実現した。

Key Facts

論文はarxiv.orgに2026年6月25日付で掲載された。[1]
MMBench2は427時間・210タスクのデータセットで、グラウンドトゥルースの行動・報酬・ライブシミュレータを含む。[1]
350Mパラメータの世界モデルを訓練し、知覚的・行動周縁化・シーン乖離の3つの幻覚モードを特定した。[1]
被覆認識サンプリングと好奇心報酬による微調整で、未見環境への適応を50の実環境トラジェクトリで実現した。[1]
研究チームは幻覚がデータ被覆問題に起因すると結論づけ、検出信号が緩和にも使えるとしている。[1]

本紙の見方

今回の研究は、世界モデルの幻覚問題を「データ被覆」という観点から統一的に説明しようとする点で新規性がある。従来、幻覚はモデルアーキテクチャや訓練手法の問題と見なされることが多かったが、本研究は状態・行動空間の低被覆領域に原因を求める。この視点は、データ収集戦略や能動学習の重要性を再確認させるものであり、ロボティクスや自動運転など実世界応用への示唆が大きい。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及はできないが、世界モデル研究の進展として、シミュレーションから実環境への転移が重要な課題であることは広く知られている。本研究は、その転移をデータ効率的に達成する手法を示しており、実用化への一歩と位置づけられる。 業界構造への含意としては、世界モデルを利用する企業や研究機関にとって、データ収集の質と被覆が競争力の鍵となることを示唆する。特に、ロボット学習や自動運転では、多様な環境データを効率的に収集する手法が重要になる。また、幻覚検出信号を好奇心報酬として使う手法は、強化学習の探索戦略にも応用可能であり、関連分野への波及効果が期待される。 未確定の論点としては、提案手法が実際の大規模モデルや多様な環境でどの程度スケールするかが挙げられる。また、幻覚モードの分類が実世界の多様な状況を十分にカバーしているか、検証が必要である。さらに、50トラジェクトリという数値は特定の環境での結果であり、汎用性については追加の評価が求められる。

なぜ重要か

世界モデルの幻覚は、ロボットや自動運転などの実世界応用における信頼性の障壁となっている。本研究は、幻覚をデータ被覆問題として捉え、検出と緩和を統一的に扱う枠組みを提供することで、実用化に向けた具体的な道筋を示した。データ効率的な適応手法は、限られた実環境データでモデルを更新する必要がある現場にとって、実践的な価値を持つ。