何が起きたか

arXivに2026-10-04付で掲載された論文「How Long, Not How Close: A Learned Temporal Metric for Planning in Latent World Models」は、潜在世界モデルの計画で使う新しい目的関数TEMPOを提案した。TEMPOは、候補行動列の終端状態とゴールの見た目の近さではなく、2つの状態の間に何環境ステップあるかを表す時間距離を学習して計画コストに組み込む。論文は、11のシミュレーション環境でLeWMとPLDMの計画器を評価し、TwoRoomの3プラン条件でLeWMを36%から99%に改善したとしている。

詳細

TEMPOは、凍結した世界モデルを変更せず、すでに学習に使ったデモンストレーションのみから学習する設計である。報酬、方策、成功ラベルは不要で、各状態に1つの潜在ベクトルを持ち、潜在距離で計画する凍結世界モデルに適用できるとしている。 実装は小さなMLPで、計画時の算術演算への追加は最大0.3%にとどまるという。評価対象は迷路ナビゲーション、卓上プッシュ、ロボットアーム制御、3次元マニピュレーションなどを含む11のシミュレーション環境で、LeWMとPLDMの両方で、著者らは全てのゴール距離で改善したとしている。

Key Facts

論文名は「How Long, Not How Close: A Learned Temporal Metric for Planning in Latent World Models」である。[1]
TEMPOは、潜在空間での「近さ」ではなく、状態間の環境ステップ数に基づく時間距離を学習して計画コストに組み込む。[1]
TEMPOは凍結した世界モデルを変更せず、デモンストレーションのみから学習し、報酬・方策・成功ラベルを必要としない。[1]
評価は11のシミュレーション環境で行われ、LeWMとPLDMの計画器が使われた。[1]
著者らはTwoRoomの3プラン条件で、LeWMが36%から99%に改善したとしている。[1]

本紙の見方

TEMPOの新規性は、潜在世界モデルそのものを学習し直すのではなく、凍結済みモデルの上に「時間距離」という別の基準を重ねた点にある。計画の失敗要因を、ゴールとの幾何学的な近さの評価に置くのではなく、ゴールまで何ステップ残っているかの推定に切り替えているため、対象はモデル本体ではなく計画器の評価関数である。ここが既存の潜在距離ベース計画との最も重要な違いである。 構造として見ると、入力はデモンストレーション、処理は凍結世界モデル内の潜在表現、出力は計画コストの補正である。つまり、環境との相互作用で新しい報酬を作る方式ではなく、既存の軌跡データから「状態Aと状態Bの間に何ステップあるか」を学び、それをLeWMやPLDMの探索に差し戻している。MLPの追加が計画時の算術に最大0.3%しか乗らないという記述は、性能向上の主因が大規模な計算増ではなく、評価軸の変更にあることを示す。 この論文が示す含意は、潜在世界モデルの弱点が「表現学習」だけでなく「ランキングの基準」にもあるという点だ。TwoRoomで36%から99%という変化が出たことから、複数プラン先の目標では、終端状態の見た目が近いほど良いという仮定が崩れやすいことがうかがえる。一方で、11環境という評価がどこまで一般化するか、実機ロボットや別系統の世界モデルでも同じ改善が出るかはまだ確認が必要だ。さらに、デモンストレーションの質、状態表現の粒度、長距離計画での挙動がどの条件で効くのかも未確定である。

なぜ重要か

潜在世界モデルを使う計画では、報酬や成功ラベルを追加せずに、既存のデモンストレーションだけで評価基準を変えられる可能性が示された。著者らの主張どおりなら、計画器の差し替えで、迷路走行からロボットアーム制御、3次元マニピュレーションまで同じ枠組みを試せる点が重要である。