何が起きたか
arXivに2026年7月29日付で掲載された論文(識別番号2607.26924v2)は、LeWorldModel(LeWM)の学習におけるSketched Isotropic Gaussian Regularizer(SIGReg)の改良手法を提案した。同論文は、SIGRegを潜在変数の周辺分布ではなく時間中心残差に適用することで、マルチタスク設定での性能低下を解決できると報告。LIBEROベンチマークの長水平スイートで下流成功率を1.7倍に改善し、4スイート全体の平均成功率を53.2%から73.6%に向上させた。
詳細
従来のSIGRegは、潜在変数の周辺分布を等方性ガウス分布に正則化することで表現崩壊を防ぎ、単一タスクでは有効だった。しかし、マルチタスク学習では、周辺ガウス化がタスク依存の潜在クラスタ間の分離をクラスタ内変動に対して圧縮し、タスク間・状態間で表現のエイリアシングを引き起こし、小さな視覚的摂動に敏感になるという問題があった。 提案手法は、SIGRegを時間中心残差に適用することで、クラスタ中心間の分離への直接的な正則化圧力を回避し、全潜在変数が単一の等方性ガウス分布に従うという要件を撤廃しつつ、SIGRegの反崩壊効果を維持する。 実験では、外部事前学習なしで、スクラッチから訓練したDiffusion Policyをわずかに上回り、大規模事前学習ポリシーベースラインに迫る性能を示した。論文は、周辺ガウス事前分布とマルチタスク潜在構造の間の構造的不適合性を明らかにし、安定かつスケーラブルなエンドツーエンドのマルチタスク世界モデル学習への簡潔な道筋を提供するとしている。
Key Facts
| 論文はarXivに2026年7月29日付で掲載された(識別番号2607.26924v2)。 | [1] |
| 提案手法はSIGRegを時間中心残差に適用する。 | [1] |
| LIBEROベンチマークの長水平スイートで下流成功率を1.7倍に改善。 | [1] |
| 4スイート全体の平均成功率を53.2%から73.6%に向上。 | [1] |
| 外部事前学習なしで、スクラッチから訓練したDiffusion Policyをわずかに上回る性能。 | [1] |
| 大規模事前学習ポリシーベースラインに迫る性能を達成。 | [1] |
| 従来のSIGRegは単一タスクでは有効だが、マルチタスクでは性能が低下。 | [1] |
| 周辺ガウス化はタスク依存の潜在クラスタ間の分離を圧縮し、表現エイリアシングを引き起こす。 | [1] |
なぜ重要か
この研究は、マルチタスク世界モデル学習における正則化手法の構造的な問題を特定し、簡潔な修正で大幅な性能向上を実現した。外部事前学習なしで大規模事前学習ベースラインに迫る性能は、エンドツーエンドの世界モデル学習の実用性を高める可能性がある。