日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ワールドモデルarXiv:2610.01373

計画のための通勤時間保存型ワールドモデルの学習

Learning Commute-Time-Preserving World Models for Planning

シェア:XThreadsFacebookLINEはてブBluesky

ラプラシアン埋め込みの固有値依存スケーリングを自己教師あり学習で再現するCTWMを提案し、目標到達計画タスクでベースラインを上回る性能を少ないパラメータで達成した。

詳しい要約

1. どんなもの?

- 目的: 潜在空間で行動選択によりゴールまでの距離を減らす計画を可能にする World Models を提案。 - 提案: Commute-Time-Preserving World Models (CTWMs)。 - 特徴: 潜在表現の距離が環境の commute-time を反映するように学習。 - 構成: latent displacement predictor と log-determinant regularizer を組み合わせる。 - 理論: 可逆決定論的ダイナミクスと予測器の固定点で、正しくスケールされた Laplacian 表現を回復することを証明。 - 検証: 数値シミュレーションで複雑な連続 goal-reaching ベンチマークにおいて、LeWM と同等以上、パラメータは半分。

2. 先行研究と比べてどこがすごい?

- 先行: グラフ Laplacian の spectral embedding は commute-time を保持するが、大規模連続環境では Laplacian の構成が困難。 - 先行: 自己教師あり学習で commute-time 保持埋め込みを大規模に学習する試みがあるが、等方性表現を促す既存手法は固有値依存スケーリングを劣化させ、commute-time を不正確に表現。 - 提案: CTWM は latent displacement predictor と log-determinant regularizer により、崩壊を防ぎつつ正しいスケーリングを回復。 - 利点: 理論的に正しい Laplacian 表現を回復し、LeWM より少ないパラメータで同等以上。

3. 技術・手法の肝は?

- 核心: latent displacement predictor と log-determinant regularizer の組み合わせ。 - 目的: 表現崩壊を防ぎつつ、commute-time を保持する埋め込みを学習。 - 理論: 可逆決定論的ダイナミクスと予測器の固定点で、正しくスケールされた Laplacian 表現を回復することを証明。 - 詳細: 等方性正則化ではなく log-determinant 正則化を用いる点が鍵。

4. どうやって有効だと検証した?

- 数値シミュレーションで検証。 - 複雑な連続 goal-reaching ベンチマークを使用。 - 比較: タスク非依存ベースライン LeWM と比較。 - 結果: CTWM は LeWM と同等以上、パラメータは半分。

5. 議論はある?

- 既存手法の問題: 等方性表現を促す手法は固有値依存スケーリングを劣化させ、commute-time を不正確に表現。 - 提案の理論的保証: 可逆決定論的ダイナミクスと固定点で正しい Laplacian 表現を回復。 - 限界: 要旨からは不明。

6. 次に読むべき論文は?

- LeWM (タスク非依存ベースライン) - グラフ Laplacian の spectral embedding - 自己教師あり学習による commute-time 保持埋め込み - 関連: 世界モデル、潜在空間計画、表現崩壊防止

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Michael Hauri, Peter Buttaroni, Fabian A. Mikulasch, Friedemann Zenke

分類: cs.LG

原文アブストラクト

World models allow agents to plan in latent space by choosing a sequence of actions that most reduces the distance to a given goal state. Thus, planning can benefit from latent representations whose distances mirror commute-times in the environment. The spectral embedding space of the graph Laplacian provides such a representation, if it obeys a specific eigenvalue-dependent scaling. Unfortunately, instantiating the graph Laplacian is intractable in large, continuous environments. Self-supervised learning offers a natural route to such commute-time-preserving embeddings at scale. However, here we show that existing methods, which commonly encourage isotropic representations to prevent representational collapse, tend to degrade the "correct" eigenvalue-dependent scaling, leading to an inaccurate representation of commute times. To address this problem, we introduce Commute-Time-Preserving World Models (CTWMs), combining a latent displacement predictor and a log-determinant regularizer that prevents collapse, which provably recover the correctly scaled Laplacian representation under reversible deterministic dynamics and at the predictor's fixed point. In numerical simulations, CTWM matches or outperforms LeWM, a task-agnostic baseline, on several complex, continuous goal-reaching benchmarks, while using half the parameters.

関連論文

PR本紙発行元 EmplifAI