何が起きたか
arXivは2026年9月19日、論文「FIRM-WM: State-factorized factual-interventional recurrent modeling for reward-free visual planning」を公開した。報酬なしの視覚計画に向けたコンパクトなピクセル世界モデルで、反復状態を目標比較可能な構成部分と、予測に使う128次元の動的ファイバーに分ける設計を採る。評価では、Three taskではなくTwoRoom、Reacher、OGBench-Cubeでそれぞれ99.0±1.0%、92.7±2.1%、88.0±3.0%を示し、LeWMの89.0%、88.0%、70.0%を上回った。
詳細
論文は、学習と計画の間にある2つのずれを前提に設計している。1つは、計画用状態が目標画像と比較可能である必要がある一方で、動力学には速度、運動傾向、接触などの履歴依存情報が必要だという点である。もう1つは、オフライン学習では1本の記録軌道が1つの実際の未来しか与えないのに対し、サンプリング型プランナーは同じ状態から選ばれなかった多数の行動を比較する点である。 FIRM-WMでは、広い実軌道で状態空間を覆いながら、共通リセットの介入分岐で代替行動列の観測結果を集める。各分岐の実行前には環境をリセットし、環境の状態設定インターフェースで露出する同じ記録値を復元する。実装規模は2.98〜3.42Mパラメータで、計画時間はこれらの課題で2.13〜11.60倍短いとしている。
Key Facts
| arXivは2026年9月19日に「FIRM-WM: State-factorized factual-interventional recurrent modeling for reward-free visual planning」を公開した。 | [1] |
| FIRM-WMは、目標比較可能な構成状態と、予測用の128次元動的ファイバーを分ける設計である。 | [1] |
| 評価結果はTwoRoomで99.0±1.0%、Reacherで92.7±2.1%、OGBench-Cubeで88.0±3.0%であった。 | [1] |
| 比較対象のLeWMはTwoRoomで89.0%、Reacherで88.0%、OGBench-Cubeで70.0%だった。 | [1] |
| 公開されたモデルは2.98〜3.42Mパラメータで、計画時間は2.13〜11.60倍短いとしている。 | [1] |
本紙の見方
FIRM-WMの新しさは、報酬なしの視覚計画を「目標と比べるための状態」と「履歴を保持するための動的状態」に分けて扱った点にある。単に世界モデルを大きくしたのではなく、終端の目標コストに入れる部分と、予測には使うが目標比較には入れない部分を分離している。これは、画像ゴールに近づくための座標系と、速度・接触のような遷移情報を同時に持たせる必要があるという問題設定に対する、構造的な回答だと読める。 もう一つの焦点は、オフライン学習で生じる「1本の軌道しか見えない」という制約への対処である。論文は、広い実軌道で状態カバレッジを確保しつつ、共通リセットの介入分岐で別行動の結果を集めている。これは、記録済みデータだけでは比較しにくい行動候補を、同一状態からの分岐として扱えるようにする発想であり、単なる予測精度の向上ではなく、計画に必要な反実仮想の取り扱いを前に出した設計だといえる。 本紙の見方としては、今回の結果は「小型の世界モデルでも、状態の分割と介入分岐の設計次第で計画性能と速度を両立しうる」ことを示した点が重要である。2.98〜3.42Mパラメータという規模で、TwoRoom、Reacher、OGBench-Cubeの3課題すべてでLeWMを上回ったことは、性能差がモデルの巨大化だけで説明されない可能性を示す。ただし、評価は3課題に限られ、CEM計画条件もそろえているため、どこまで一般化するかはまだ限定的だ。 今後確認すべき論点は、(1) 介入分岐を増やしたときの学習安定性、(2) 128次元の動的ファイバーが他環境でも妥当か、(3) 2.98〜3.42Mパラメータという構成が高解像度や長期依存の課題にそのまま拡張できるか、(4) 計画時間短縮がモデル構造由来なのか実装条件由来なのか、である。
なぜ重要か
論文は、報酬に依存しない画像ベースの計画で、状態の分割と介入分岐が性能と計画時間の両方に効く可能性を示した。これは、オンライン試行が高コストな環境で、記録データをどう反実仮想的に使うかという課題に関係する。