何が起きたか

arXivに公開された論文(識別番号2608.09730v1)において、World Tokensと名付けられた新しい組み込みポリシーアーキテクチャが提案された。このアーキテクチャは、World Adapterを中心に、視覚言語理解、世界ダイナミクスモデリング、行動生成を橋渡しする。訓練時には、VLM特徴を固定数のワールドトークンに変換し、これが共同で微調整された未来ビデオデノイザーと行動エキスパートの両方に条件付けられる。これにより、未来ビデオのデノイジングからの勾配が行動予測に使われる表現を直接形成する一方、排他的ルーティングによりポリシーがその表現を迂回することを防ぐ。展開時にはワールドモデルブランチを除去し、VLM、World Adapter、行動エキスパートのみを残すため、オンラインでのビデオモデル推論は不要となる。

Key Facts

World Tokensは、World Adapterを中心とした組み込みポリシーアーキテクチャであり、視覚言語理解、世界ダイナミクスモデリング、行動生成を橋渡しする。[0]
World AdapterはVLM特徴を固定数のワールドトークンに変換し、これが共同で微調整された未来ビデオデノイザーと行動エキスパートの両方に条件付けられる。[0]
展開時にはワールドモデルブランチを除去し、VLM、World Adapter、行動エキスパートのみを残すため、オンラインでのビデオモデル推論は不要となる。[0]
2Bバックボーンと組み込み行動事前学習なしで、World TokensはLIBEROで非常に競争力があり、SIMPLERで報告された平均値の最高を達成した。[0]
実世界のR1 Proで、行動のみのベースラインと比較して成功率が大幅に向上した。[0]
各行動チャンクをVLAレベルのレイテンシで生成する。[0]

なぜ重要か

この研究は、VLAモデルにワールドモデリングを統合する際の推論コスト増加という課題に対処するものである。訓練時のみワールドモデルを使用し、展開時には除去することで、効率的な展開を維持しながら性能を向上させる可能性を示している。