論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ワールドモデルロボティクス
イベント条件付き診断:受動的オブジェクト状態ワールドモデルにおける運動学的・接触・物体永続性フィールドの解析
物理的状態を予測するワールドモデルの内部表現が、自由運動・衝突・遮蔽などのイベントに応じてどのように情報を編成・再重み付けするかを診断する手法を提案し、予測への機能的影響を検証した。
原題: Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models / Yang Liu, Yuming Chen
日本語で読む → - 論文ワールドモデル画像認識
Mem-World: 持続的なロボット操作のためのメモリ拡張型行動条件付きワールドモデル
手首カメラの動きや遮蔽により過去の情報が失われる問題を解決するため、4Dサーフェルインデックスメモリを導入し、幾何学的に履歴フレームを検索・活用する行動条件付きワールドモデルを提案した。
原題: Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation / Zirui Zheng, Jiaqian Yu, Xiongfeng Peng 他
日本語で読む → - 論文拡散ポリシー/時相論理/ワールドモデルロボティクス
時相論理によるアクションのみの拡散ポリシーへのガイダンス:ワールドモデルを用いた手法
アクションのみを生成する拡散ポリシーに対し、学習済みワールドモデルを用いてSTLロバストネスを微分可能に評価し、その勾配を拡散過程に注入することで、再学習なしに制約充足を改善する手法を提案。Robomimicのタスクで成功率100%を維持しつつ制約違反を大幅削減した。
原題: Temporal Logic Guidance for Action-Only Diffusion Policies with World Models / Moritz Zoellner, Anastasios Manganaris, Rohan Paleja
日本語で読む → - 論文ビデオワールドモデル画像認識
WorldCraft: カメラナビゲーションからオブジェクト操作へ - インタラクティブビデオワールドモデルにおける
ビデオベースのワールドモデルをカメラ操作からオブジェクトレベルの軌跡操作へ拡張するフレームワークを提案。ユーザーのクリックと描画パスに基づき、選択オブジェクトが軌跡に沿って動く未来フレームを生成する。
原題: WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models / Bohai Gu, Taiyi Wu, Yueyang Yuan 他
日本語で読む → - 論文ワールドモデル機械学習
ワールドモデルのための識別可能なトークン対応付け
トークンベースのトランスフォーマーワールドモデルにおける長期的な時間的不整合(物体の重複や消失など)を解決するため、次フレーム予測を構造化割り当て問題として定式化し、各トークンを前フレームからのコピーか新規生成かで対応付ける復号ステップを提案した。
原題: Identifiable Token Correspondence for World Models / Youngin Kim, Ray Sun, Inho Kim 他
日本語で読む → - 論文ワールドモデル機械学習
拡散ワールドモデルのための記憶専門家の構成
拡散ベースのワールドモデルにおいて、短期・長期・空間記憶の専門家を対照的な専門家積で統合し、過去の観測との整合性を保ちつつ長いコンテキストを効率的に扱う手法を提案した。
原題: Composition of Memory Experts for Diffusion World Models / Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan 他
日本語で読む → - 論文ワールドモデル機械学習
Atariにおけるデータ効率的な汎用トランスフォーマーワールドモデルに対するスケールの影響の調査
Atari 100kベンチマークで、最小限のトランスフォーマーワールドモデルを用いて、モデル規模が環境ごとに異なるスケーリング挙動を示すことを明らかにし、統合トレーニングがスケーリングダイナミクスを安定化させることを実証した。
原題: Probing the Impact of Scale on Data-Efficient, Generalist Transformer World Models for Atari / Jooyeon Kim
日本語で読む → - 論文ナビゲーションワールドモデル画像認識
アンカー付きエピポーラガイダンスによるドリフト耐性ナビゲーションワールドモデル
逐次ロールアウトによるノイズ蓄積と幾何学的ドリフトを防ぐため、疎な未来アンカーを予測し、その間のフレームを生成する新しいワールドモデルを提案。双方向エピポーラ幾何でアンカーを拘束し、長期的な視覚品質と幾何的一貫性を向上させた。
原題: Drift-Resistant Navigation World Model with Anchored Epipolar Guidance / Po-Chien Luan, Zimin Xia, Wuyang Li 他
日本語で読む → - 論文ワールドモデル画像認識
EA-WM: イベント認識型生成ワールドモデルと構造化された運動学から視覚へのアクションフィールド
ロボットのワールドモデルにおいて、アクション信号を利用してビデオ生成を誘導し、正確なロボットの空間幾何学と物体との相互作用を保持する新しい生成モデルを提案した。
原題: EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields / Zhaoyang Yang, Yurun Jin, Lizhe Qi 他
日本語で読む → - 論文計画/ワールドモデルロボティクス
探索を超えた潜在幾何学:ワールドモデルにおける計画の償却
滑らかで一様な潜在空間を持つ事前学習済みワールドモデルにおいて、反復的なオンライン探索を軽量な目標条件付き逆動力学モデル(GC-IDM)に置き換え、計画を償却する手法を提案。4つのベンチマークでCEM等と同等以上の性能を維持しつつ、計算コストを100〜130倍削減した。
原題: Latent Geometry Beyond Search: Amortizing Planning in World Models / Hoang Nguyen, Xiaohao Xu, Xiaonan Huang
日本語で読む → - 論文物理シミュレーション/ニューラルワールドモデル画像認識
DeformMaster: ビデオから変形物体のための対話型物理ニューラルワールドモデル
実ビデオから変形物体の物理ダイナミクスと外観を学習し、新しい操作や視点での未来予測とレンダリングを可能にする統一モデルを提案。
原題: DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos / Can Li, Zhoujian Li, Ren Li 他
日本語で読む → - 論文ワールドモデル/強化学習機械学習
PH-Dreamer: ポート・ハミルトン生成ダイナミクスによる物理駆動ワールドモデル
リカレント状態空間モデルにポート・ハミルトン構造を導入し、物理法則に従う潜在ダイナミクスを学習するワールドモデルを提案。エネルギー勾配を用いたActor-Criticで制御を最適化し、報酬予測精度とエネルギー効率を向上させた。
原題: PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics / Xueyu Luan, Chenwei Shi
日本語で読む → - 論文ワールドモデル機械学習
stable-worldmodel: 再現可能なワールドモデル研究と評価のためのプラットフォーム
ワールドモデル研究の断片化を解消するため、高速データ層、標準ベースライン実装、多様な評価環境を備えたオープンソースプラットフォームを提案した。
原題: stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation / Lucas Maes, Quentin Le Lidec, Luiz Facury 他
日本語で読む → - 論文ワールドモデル/ストリーミングロボティクス
ネットワーク効率的なワールドモデルトークンストリーミング
運転用ワールドモデルの離散トークン状態を、帯域制約下で効率的にストリーミングする適応的キーフレーム・デルタ方式を提案し、歪みとパープレキシティの改善を示した。
原題: Network-Efficient World Model Token Streaming / Shatadal Mishra, Ahmadreza Moradipari, Nejib Ammar
日本語で読む → - 論文ワールドモデルAI
AGIにワールドモデルが必要な理由:LLMの限界とワールドモデルの優位性
大規模言語モデルは因果推論や長期的計画が苦手で、その原因を潜在環境ダイナミクスの推論不足と分析。自然言語ルールから状態遷移シミュレータを構築し、LLMと強化学習エージェントを比較した結果、潜在状態を明示的に扱うエージェントが長期的なゲームで高い勝率を示した。
原題: Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform / Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal 他
日本語で読む → - 論文ベンチマーク/ワールドモデルロボティクス
ロボット操作におけるワールドモデル評価のためのベンチマーク RoboWM-Bench
ロボット操作タスクに特化した、ビデオワールドモデルの物理的実行可能性を評価するベンチマークを提案。生成動画を実行動作に変換し、シミュレーションで検証する。
原題: RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation / Feng Jiang, Yang Chen, Kyle Xu 他
日本語で読む → - 論文自動運転/ワールドモデル画像認識
インフラ中心のワールドモデル:路側知覚における時間的深さと空間的広がりの橋渡し
自動運転のワールドモデルを、車両視点ではなく路側インフラ視点で構築する新たなパラダイムを提案し、その利点とアーキテクチャを論じた論文。
原題: Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception / Siyuan Meng, Chengbo Ai
日本語で読む → - 論文評価/ワールドモデルロボティクス
dWorldEval: 離散拡散ワールドモデルによるスケーラブルなロボットポリシー評価
ロボットポリシーを数千環境・数千タスクで評価するため、視覚・言語・行動を統一トークン空間に写像し、単一のTransformerベースの離散拡散ワールドモデルを評価プロキシとして用いる手法を提案。
原題: dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model / Yaxuan Li, Zhongyi Zhou, Yefei Chen 他
日本語で読む → - 論文ワールドモデルロボティクス
形態条件付けによるハードウェア非依存の四足歩行ワールドモデルに向けて
四足歩行ロボットのワールドモデルを、ロボットの形態情報を明示的に条件付けすることで、異なるハードウェア間でゼロショット汎化可能にする手法を提案した論文。
原題: Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning / Mohamad H. Danesh, Chenhao Li, Amin Abyaneh 他
日本語で読む → - 論文ワールドモデル/解釈可能性機械学習
強化学習におけるワールドモデルは何を学習するのか?環境シミュレータの潜在表現の探索
強化学習用のワールドモデル内部の表現を解釈可能性手法で分析し、ゲーム状態の変数が線形に解読可能な形で表現され、因果介入により機能していることを示した。
原題: What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators / Xinyu Zhang
日本語で読む → - 論文ワールドモデル画像認識
ピクセル履歴を超えて:持続的3D状態を持つワールドモデル
環境・カメラ・レンダラーの潜在3Dシーンを進化させる新しいワールドモデルPERSISTを提案し、空間記憶と幾何的一貫性を向上させた。
原題: Beyond Pixel Histories: World Models with Persistent 3D State / Samuel Garcin, Thomas Walker, Steven McDonagh 他
日本語で読む → - 論文ワールドモデル/sim2realロボティクス
シミュレーション蒸留:実世界への迅速な適応のためのシミュレーションでのワールドモデル事前学習
物理シミュレータから得た行動条件付き経験をワールドモデルに蒸留し、実世界ではエンコーダ等を固定して潜在ダイナミクスのみを更新することで、接触を伴う操作や歩行タスクで迅速な適応を実現する手法を提案した。
原題: Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation / Jacob Levy, Tyler Westenbroek, Kevin Huang 他
日本語で読む → - 論文ワールドモデル機械学習
WestWorld: 多様なロボットシステム向けの知識符号化スケーラブル軌道ワールドモデル
多様なロボットシステムの軌道予測をスケーラブルに行うため、システム認識型Mixture-of-Expertsと構造埋め込みを導入したワールドモデルを提案し、シミュレーションと実機で性能を実証した。
原題: WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems / Yuchen Wang, Jiangtao Kong, Sizhe Wei 他
日本語で読む → - 論文ワールドモデル機械学習
基盤ワールドモデル:静的環境を超えて学習・検証・適応するエージェントに向けて
強化学習・プログラム合成・抽象化を統合した「基盤ワールドモデル」のビジョンを提示し、報酬モデル学習・適応的形式検証・オンライン抽象化校正・テスト時合成の4要素からなる研究課題を提案する。
原題: Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments / Florent Delgrange
日本語で読む → - 論文ワールドモデル機械学習
不変な視覚表現を学習する連合埋め込み予測ワールドモデルによる計画
bisimulationエンコーダを予測目的に追加し、背景変化や妨害物に頑健な潜在空間での計画を可能にするワールドモデルを提案。DINO-WMより最大10倍小さい潜在空間で堅牢性を向上。
原題: Learning Invariant Visual Representations for Planning with Joint-Embedding Predictive World Models / Leonardo F. Toso, Davit Shadunts, Yunyang Lu 他
日本語で読む → - 論文ワールドモデル機械学習
因子分解型潜在行動ワールドモデル
動画から潜在行動を学習する際、シーンを複数の独立因子に分解し、各因子が独自の潜在行動を推論・予測するフレームワークFLAMを提案。複数エンティティが同時に動く複雑な環境での予測精度と表現品質を向上させ、下流の政策学習を容易にする。
原題: Factored Latent Action World Models / Zizhao Wang, Chang Shi, Jiaheng Hu 他
日本語で読む → - 論文ワールドモデル機械学習
Policy4OOD: オピオイド過剰摂取危機に対する政策介入シミュレーションのための知識誘導型ワールドモデル
政策知識グラフ・空間依存性・時系列データを統合したTransformer型ワールドモデルを構築し、オピオイド政策の予測・反事実分析・最適化を可能にするシミュレータを提案した。
原題: Policy4OOD: A Knowledge-Guided World Model for Policy Intervention Simulation against the Opioid Overdose Crisis / Yijun Ma, Zehong Wang, Weixiang Sun 他
日本語で読む → - 論文ワールドモデル機械学習
地平線イマジネーション:拡散ワールドモデルにおける効率的なオンポリシーロールアウト
拡散ベースのワールドモデルで、複数の将来観測を並列にノイズ除去するオンポリシー・イマジネーション手法を提案し、計算コストを抑えつつ制御性能を維持できることを示した。
原題: Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models / Lior Cohen, Ofir Nabati, Kaixin Wang 他
日本語で読む → - 論文医療AI/ワールドモデルAI
EHRWorld: 長期的な臨床経過をシミュレートする患者中心の医療ワールドモデル
電子カルテから構築した大規模縦断データセットEHRWorld-110Kを用い、因果的逐次パラダイムで訓練した患者中心の医療ワールドモデルEHRWorldを提案し、長期的な臨床シミュレーションの安定性と精度を向上させた。
原題: EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories / Linjie Mu, Zhongzhen Huang, Yannian Gu 他
日本語で読む → - 論文ワールドモデル機械学習
ワールドモデルによるニューラルセイバーメトリクス:大規模言語モデルを用いたプレー・バイ・プレー予測モデリング
MLBの10年以上のトラッキングデータでLLMを継続事前学習し、野球のプレー・バイ・プレーを予測するワールドモデルを構築した研究。
原題: Neural Sabermetrics with World Model: Play-by-play Predictive Modeling with Large Language Model / Young Jin Ahn, Yiyang Du, Zheyuan Zhang 他
日本語で読む →