何が起きたか

2026年2月5日にarXivで公開された論文『Self-Improving World Modelling with Latent Actions』において、SWIRLという自己改善フレームワークが提案された。SWIRLは、行動ラベルを必要とせず、状態遷移のみから世界モデルを学習する。AURORABenchで16%、ByteMorphで28%、WorldPredictionBenchで16%、StableToolBenchで14%の性能向上を達成したと報告されている。

詳細

SWIRLは、状態Xから次の状態Yへの遷移を行動Zの下で予測する世界モデルを学習する。行動を潜在変数として扱い、前方世界モデル(FWM)P_θ(Y|X,Z)と逆動力学モデル(IDM)Q_φ(Z|X,Y)を交互に更新する。具体的には、変分情報最大化によりFWMを更新し、ELBO最大化によりIDMを更新する座標上昇法を採用する。両モデルは、相手のモデルの対数確率を報酬信号として強化学習(GRPO)で訓練される。理論的な学習可能性の保証も提供されている。評価は、LLMとVLMを用いて、単一ターン・複数ターンのオープンワールド視覚ダイナミクス、物理・ウェブ・ツール呼び出しの合成テキスト環境で行われた。

Key Facts

SWIRLは、状態のみのシーケンスから学習し、行動を潜在変数として扱う自己改善フレームワークである。[1]
SWIRLは、前方世界モデル(FWM)と逆動力学モデル(IDM)を交互に更新する。[1]
SWIRLは、GRPOを用いた強化学習で訓練され、相手のモデルの対数確率を報酬信号とする。[1]
SWIRLは、AURORABenchで16%、ByteMorphで28%、WorldPredictionBenchで16%、StableToolBenchで14%の性能向上を達成した。[1]
SWIRLは、LLMとVLMに対して、複数の環境で評価された。[1]

本紙の見方

今回のSWIRLの提案は、世界モデル学習における行動ラベルの必要性を低減する点で新規性がある。従来の世界モデル学習は、行動ラベル付きの軌跡データを必要とすることが多く、その取得コストが課題だった。SWIRLは、状態遷移のみから潜在行動を推定することで、このコストを回避する。これは、ロボット工学やシミュレーション環境など、行動ラベルの取得が困難な領域での応用可能性を示唆する。 本紙の過去報道との接続は、関連記事が提供されていないため、直接的な言及はできない。しかし、世界モデル研究の文脈では、自己教師あり学習や強化学習との組み合わせが進展しており、SWIRLはその流れに位置づけられる。特に、GRPOを用いた強化学習を内部モデルの学習に適用する点は、近年のLLMの推論能力向上技術(例:DeepSeek-R1)との類似性があり、興味深い。 業界構造への含意としては、世界モデルの学習コスト低減は、基盤モデル開発企業にとって重要な意味を持つ。行動ラベル付きデータの収集は高価であり、その依存度を下げることで、より多様な環境でのモデル学習が可能になる。また、SWIRLの理論的保証は、モデルの学習可能性に関する信頼性を高め、実用化への道筋を明確にする。 未確定の論点としては、SWIRLの実環境でのスケーラビリティが挙げられる。論文では合成環境やベンチマークでの評価が中心であり、実世界の複雑なダイナミクスでの性能は未知数である。また、潜在行動の解釈可能性や、学習された世界モデルの安全性についても、今後の検証が必要である。次に確認すべきは、SWIRLが実ロボットや複雑なシミュレーション環境でどの程度機能するか、そして学習データの多様性が性能に与える影響である。

なぜ重要か

SWIRLは、世界モデル学習における行動ラベルの必要性を低減する手法であり、データ収集コストの削減と応用範囲の拡大につながる可能性がある。理論的保証と複数ベンチマークでの性能向上は、この分野の進展を示すものであり、今後の基盤モデル開発に影響を与えるとみられる。