論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/2 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ワールドモデル機械学習
生成的可視コードによるモバイルワールドモデル
単一のVLMが次のGUI状態を実行可能なWebコードとして予測し、それをレンダリングすることで高忠実度なモバイルGUIワールドモデルを実現した研究。
原題: Generative Visual Code Mobile World Models / Woosung Koh, Sungjun Han, Segyu Lee 他
日本語で読む → - 論文ワールドモデル画像認識
DISK: ワールドモデル向け動的推論スキップ
自動回帰型ワールドモデルにおいて、動画と自己軌跡の拡散トランスフォーマーを二重分岐制御器で協調させ、再学習なしに適応的に推論をスキップする手法を提案。運転シナリオで品質を保ちつつ最大2倍の高速化を実現。
原題: DISK: Dynamic Inference SKipping for World Models / Anugunj Naman, Gaibo Zhang, Ayushman Singh 他
日本語で読む → - 論文ワールドモデル画像認識
DDP-WM: 効率的なワールドモデルのための分離型ダイナミクス予測
観測シーンの潜在状態変化を、物理相互作用による疎な主要ダイナミクスと背景更新に分離して予測するワールドモデルを提案し、推論を約9倍高速化しつつ操作タスクの成功率を向上させた。
原題: DDP-WM: Disentangled Dynamics Prediction for Efficient World Models / Shicheng Yin, Kaixuan Yin, Weixing Chen 他
日本語で読む → - 論文ワールドモデル機械学習
CASSANDRA: 確率的ワールドモデリングのためのプログラム的・確率論的学習と推論
LLMを知識事前分布として活用し、決定論的特徴をコードで、確率的因果関係を確率グラフィカルモデルでモデル化するニューロシンボリックなワールドモデルを提案し、計画精度を向上させた。
原題: CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling / Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Ian Berlot-Attwell 他
日本語で読む → - 論文ワールドモデル機械学習
流れ同変ワールドモデル:部分観測動的環境のための記憶
自己運動と物体運動に応じて潜在記憶を同変的に移動・変換することで、部分観測下でも長期的な動力学予測を安定かつ高精度に行うワールドモデルを提案した。
原題: Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments / Hansen Jin Lillemark, Benhao Huang, Fangneng Zhan 他
日本語で読む → - 論文ワールドモデルロボティクス
ReWorld: 身体性ワールドモデルのための多次元報酬モデリング
ロボット学習向け動画ベースのワールドモデルを、物理的忠実性・タスク論理・身体性・視覚品質の多次元報酬で強化学習により人間の選好に整合させるフレームワークを提案。
原題: ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models / Baorui Peng, Wenyao Zhang, Liang Xu 他
日本語で読む → - 論文ワールドモデル機械学習
ラベルなし軌道を活用する潜在行動ワールドモデル
行動ラベル付きデータとラベルなしデータを共通の潜在行動表現で統合し、オフライン強化学習により効率的に制御方策を学習する手法を提案。
原題: Latent Action World Models for Control with Unlabeled Trajectories / Marvin Alles, Xingyuan Zhang, Patrick van der Smagt 他
日本語で読む → - 論文物理シミュレーション/ワールドモデルphysics.optics
FieldSeer I: 部分観測下での長期的電磁ダイナミクスに向けた物理誘導型ワールドモデル
2次元TE導波路における部分観測から電磁場の時間発展を予測する幾何条件付きワールドモデルを提案し、FDTDベンチマークで既存手法より高精度な長期ロールアウトを実現した。
原題: FieldSeer I: Physics-Guided World Models for Long-Horizon Electromagnetic Dynamics under Partial Observability / Ziheng Guo, Fang Wu, Maoxiong Zhao 他
日本語で読む → - 論文自動運転/ワールドモデルロボティクス
車両ダイナミクスを組み込んだ自動運転向けワールドモデル
自車のダイナミクスと環境の遷移を分離して学習するワールドモデルを提案し、多様な車両パラメータへの汎化と運転性能・ロバスト性を向上させた。
原題: Vehicle Dynamics Embedded World Models for Autonomous Driving / Huiqian Li, Wei Pan, Haodong Zhang 他
日本語で読む → - 論文ワールドモデルロボティクス
MIND-V: 物理整合のための強化学習を用いた階層型ワールドモデルによる長期的ロボットマニピュレーション
認知科学に着想を得た階層型ワールドモデルMIND-Vを提案し、物理的に妥当で論理的に一貫した長期的ロボット操作動画を合成する。強化学習による物理整合でSOTAを達成。
原題: MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment / Ruicheng Zhang, Mingyang Zhang, Jun Zhou 他
日本語で読む → - 論文ワールドモデルAI
ChronoDreamer: ロボット計画のためのオンラインシミュレータとしての行動条件付きワールドモデル
接触の多いロボット操作のため、RGB・接触マップ・行動・関節状態から将来の映像や接触分布を予測するワールドモデルを提案し、VLMによる衝突判定で安全な行動選択を可能にした。
原題: ChronoDreamer: Action-Conditioned World Model as an Online Simulator for Robotic Planning / Zhenhao Zhou, Dan Negrut
日本語で読む → - 論文強化学習/ワールドモデルロボティクス
RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
原題: RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL / Yinzhou Tang, Yu Shang, Yinuo Chen 他
日本語で読む → - 論文生物学的ワールドモデルq-bio.CB
VCWorld:仮想細胞シミュレーションのための生物学的ワールドモデル
構造化された生物学的知識と大規模言語モデルの推論を組み合わせ、摂動に対する細胞応答を解釈可能なステップごとの予測として再現するホワイトボックス型仮想細胞モデルを提案。
原題: VCWorld: A Biological World Model for Virtual Cell Simulation / Zhijian Wei, Runze Ma, Zichen Wang 他
日本語で読む → - 論文ワールドモデル機械学習
構造化ワールドモデルのための自然な構成要素:理論・証拠・スケーリング
離散過程と連続過程を基本構成要素とし、HMMやsLDSを階層的に組み合わせることで、解釈性を保ちつつ生成・予測・計画・意思決定を同一アーキテクチャで行う構造化ワールドモデルの枠組みを提案する。
原題: Natural Building Blocks for Structured World Models: Theory, Evidence, and Scaling / Lancelot Da Costa, Sanjeev Namjoshi, Mohammed Abbas Ansari 他
日本語で読む → - 論文ワールドモデル機械学習
Jasmine: シンプルで高性能・スケーラブルなJAXベースのワールドモデリングコードベース
JAXを用いた高性能なワールドモデル学習基盤を提案し、単一ホストから数百アクセラレータまでスケール可能で、CoinRun事例を従来より桁違いに高速に再現できることを示した。
原題: Jasmine: A Simple, Performant and Scalable JAX-based World Modeling Codebase / Mihir Mahajan, Alfred Nguyen, Franz Srambical 他
日本語で読む → - 論文ワールドモデル機械学習
共進化する潜在行動ワールドモデル
潜在行動モデルとワールドモデルをウォームアップ段階を介して初めて同時学習させ、相互に進化させる新手法CoLA-Worldを提案した。
原題: Co-Evolving Latent Action World Models / Yucen Wang, Fengming Zhang, De-Chuan Zhan 他
日本語で読む → - 論文ワールドモデルロボティクス
Ctrl-World: ロボットマニピュレーションのための制御可能な生成ワールドモデル
多視点予測と細かい行動制御、長期一貫性を備えた制御可能なワールドモデルを提案し、汎用ロボット政策の評価と改善を可能にした。
原題: Ctrl-World: A Controllable Generative World Model for Robot Manipulation / Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen 他
日本語で読む → - 論文ワールドモデルロボティクス
プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けて
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
原題: Learning Primitive Embodied World Models: Towards Scalable Robotic Learning / Qiao Sun, Liujia Yang, Wei Tang 他
日本語で読む → - 論文LiDARワールドモデル画像認識
効率的な潜在フローマッチングによる基盤的LiDARワールドモデル
LiDARワールドモデルのドメイン間転移性を初めて体系的に検証し、潜在条件付きフローマッチングで高圧縮・高精度な基盤モデルを実現した。
原題: Towards foundational LiDAR world models with efficient latent flow matching / Tianran Liu, Shengwen Zhao, Nicholas Rhinehart
日本語で読む → - 論文ワールドモデルロボティクス
ParticleFormer: 多物体・多素材ロボット操作のための3D点群ワールドモデル
剛体・変形・柔軟素材が混在する多物体操作を対象に、実ロボット知覚データから直接学習できるTransformerベースの3D点群ワールドモデルを提案し、MPCによる下流操作タスクで高精度な動力学予測を実現した。
原題: ParticleFormer: A 3D Point Cloud World Model for Multi-Object, Multi-Material Robotic Manipulation / Suning Huang, Qianzhong Chen, Xiaohan Zhang 他
日本語で読む → - 論文ワールドモデル画像認識
3D永続的具現化ワールドモデルの学習
過去に生成した内容を明示的に記憶する3Dマップを条件付けし、RGB-D動画拡散モデルで長期的に一貫した未来予測を可能にする永続的ワールドモデルを提案。計画や方策学習に有効性を示す。
原題: Learning 3D Persistent Embodied World Models / Siyuan Zhou, Yilun Du, Yuncong Yang 他
日本語で読む → - 論文ワールドモデルロボティクス
FlowDreamer: フローベースの動作表現を用いたロボットマニピュレーションのためのRGB-Dワールドモデル
3Dシーンフローを明示的な動作表現として用い、U-Netと拡散モデルを組み合わせてロボット操作のためのRGB-Dワールドモデルを構築し、映像予測と視覚計画タスクで性能を向上させた。
原題: FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation / Jun Guo, Xiaojian Ma, Yikai Wang 他
日本語で読む → - 論文ワールドモデル画像認識
GAIA-2: 自動運転のための制御可能なマルチビュー生成ワールドモデル
自動運転向けに、自車挙動やエージェント配置、環境要因、道路意味論などの構造化入力で制御可能な、マルチカメラで時空間的に一貫した高解像度動画を生成する潜在拡散ワールドモデルを提案。
原題: GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving / Lloyd Russell, Anthony Hu, Lorenzo Bertoni 他
日本語で読む → - 論文自動運転/ワールドモデルロボティクス
Imagine-2-Drive: マルチモーダル拡散ポリシーによる高忠実度ワールドモデル活用
拡散モデルで未来の観測を一括生成する高忠実度ワールドモデルと、多様な軌道分布を表現する拡散ポリシーを組み合わせ、自動運転の強化学習を少ないオンライン相互作用で高精度化した研究。
原題: Imagine-2-Drive: Leveraging High-Fidelity World Models via Multi-Modal Diffusion Policies / Anant Garg, K Madhava Krishna
日本語で読む → - 論文ワールドモデルロボティクス
DINO-WM: 事前学習済み視覚特徴量上のワールドモデルによるゼロショット計画
DINOv2のパッチ特徴量を予測するワールドモデルをオフライン軌道から学習し、行動列最適化により未見タスクをゼロショットで計画する手法を提案。
原題: DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning / Gaoyue Zhou, Hengkai Pan, Yann LeCun 他
日本語で読む →