日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデルarXiv:2610.01019

FutureWorlds: 代替未来からロボット世界モデルを学習する

FutureWorlds: Learning Robotic World Models from Alternative Futures

シェア:XThreadsFacebookLINEはてブBluesky

マルチモーダル離散自己回帰モデルと多様性ビーム探索、候補ごとの記憶保持、MemSPO最適化を組み合わせ、ロボットの行動条件付き未来予測を高精度化する枠組みを提案。

詳しい要約

1. どんなもの?

- ロボティクス向けの world model を学習するフレームワーク FutureWorlds を提案 - action-conditioned な将来シーンの予測を対象とする - 候補生成・履歴維持・相対品質からの学習を統合 - multimodal discrete autoregressive model を基盤とする - コードとプロジェクトページを公開

2. 先行研究と比べてどこがすごい?

- 従来は類似候補では品質比較が困難、多様な軌跡では履歴維持が課題 - diverse beam search により confidence と diversity を両立した候補を構築 - candidate-specific bounded memory で生成と policy scoring の履歴を一致させる - 相対品質からの学習を可能にした点が先行研究と異なる - 各データセットの最強 baseline 比で LPIPS を削減

3. 技術・手法の肝は?

- multimodal discrete autoregressive model を採用 - reinforcement learning 中に diverse beam search で候補未来を生成 - candidate-specific bounded memory で scene state を保持 - MemSPO (Memory-Conditioned Search-Guided Policy Optimization) を提案 - video trajectory rewards を group-relative advantages に変換し world model を最適化

4. どうやって有効だと検証した?

- RT-1, BridgeV2, RoboCasa で評価 - 32-frame 予測の LPIPS を最強 baseline 比で 14.78%, 20.84%, 9.12% 削減 - 固定評価設定で 200 MemSPO updates により生成品質が向上 - 訓練 horizon を超えた予測継続を確認 - memory ablations, decoding sensitivity analysis, optical-flow evaluation を実施

5. 議論はある?

- 利得は視覚品質に留まらず motion prediction と object state の一貫性にも及ぶ - memory の寄与や decoding 感度を分析 - 訓練 horizon を超えた予測継続が可能 - 限界や失敗事例の詳細は要旨からは不明 - 計算コストやスケーラビリティの議論は要旨からは不明

6. 次に読むべき論文は?

- RT-1, BridgeV2, RoboCasa を用いた関連研究 - multimodal discrete autoregressive model 系の world model - diverse beam search を用いる生成手法 - reinforcement learning による world model 最適化手法 - optical-flow 評価や memory 機構の関連研究

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Hao Wu, Shengju Qian, Weiyan Wang, Fan Xu, Fan Zhang, Yuanpeng He, Qingsong Wen, Yuxuan Liang

分類: cs.CV, cs.RO

原文アブストラクト

Robotic world models predict action-conditioned future scenes, providing a foundation for understanding action outcomes. However, turning alternative predictions into useful learning signals remains challenging: similar candidates limit informative quality comparisons, while diverging trajectories require persistent maintenance of their individual histories. We introduce FutureWorlds, a framework that unifies candidate construction, history maintenance, and learning from relative quality. Built on a multimodal discrete autoregressive model, FutureWorlds uses diverse beam search during reinforcement learning to construct candidate futures that balance confidence and diversity. Candidate-specific bounded memory preserves scene states and ensures that generation and policy scoring use matching histories. We further propose MemSPO (Memory-Conditioned Search-Guided Policy Optimization), which converts video trajectory rewards into group-relative advantages to optimize the world model. On RT-1, BridgeV2, and RoboCasa, FutureWorlds reduces LPIPS for 32-frame predictions by 14.78%, 20.84%, and 9.12%, respectively, relative to the strongest baseline on each dataset. Under fixed evaluation configurations, only 200 MemSPO updates further improve generation quality and support continued prediction beyond the training horizon. Memory ablations, decoding sensitivity analysis, and optical-flow evaluation show that these gains extend beyond visual quality to more accurate motion prediction and more consistent object states. Project page and code: https://github.com/Alexander-wu/FutureWorlds.

関連論文

PR本紙発行元 EmplifAI