論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ビデオワールドモデル画像認識
ShadowDancer: ビデオとその影から統一力学表現を学習し、ビデオワールドモデルに任意のアクションを教える
デモ動画のペア(シャドウペア)を用いて、見た目に依存しない統一的な力学表現を学習し、任意のアクションをフレームレベルで制御できるビデオワールドモデルを提案した。
原題: ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow / Jin Cao, Zian Meng, Kaipeng Zhang
日本語で読む → - 論文ワールドモデルAI
CG-World: ワールドモデルのための大規模ワールド状態データセットとプロトコル
産業用CG制作パイプラインから派生した、状態・行動・イベント・観測を統合的に記録する大規模ワールド状態データセットとプロトコルを提案し、介入学習や反事実推論を可能にする。
原題: CG-World: A Large-Scale World-State Dataset and Protocol for World Models / Yiming Cai, Fangjie Yu, Meiqing Yu 他
日本語で読む → - 論文ワールドモデル画像認識
ABot-World-0: 単一デスクトップGPU上での無限インタラクティブワールドロールアウト
単一のデスクトップGPUでリアルタイムに長時間のインタラクティブなビデオ生成を実現するアクション条件付きワールドモデルを提案し、データ収集から推論最適化までを統合したシステムを構築した。
原題: ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU / Fan Jiang, Zhaoxu Sun, Mengchao Wang 他
日本語で読む → - 論文ワールドモデルAI
概念誘導型空間正則化によるAtari Pongのワールドモデル改善
Atari Pongの5つの視覚ワールドモデルを再現し、凍結モデルのロールアウト診断とピクセル空間ゼロショットMBRLで性能低下を確認。ボールなどのタスク重要概念のモデリング不足が原因と仮説し、概念領域の補助再構成損失CGSRegを提案して改善を図る。
原題: Concept-Guided Spatial Regularization for World Models in Atari Pong / Yukuan Lu, Zaishuo Xia, Weyl Lu 他
日本語で読む → - 論文ワールドモデル機械学習
言語接地ワールドモデルのための書き込み保護離散ボトルネック:構造的限界と十分な修正
言語特徴をロボットのワールドモデルに注入する既存手法が、Gumbel-softmax離散ボトルネックで構造的失敗を起こすことを示し、勾配遮断・非パラメトリック記憶表・DP-Meansクラスタリングの3層修正で接地精度を大幅改善した。
原題: Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix / Jiayi Fang
日本語で読む → - 論文ワールドモデルAI
ワールドモデルの定義とロードマップ
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
原題: A Definition and Roadmap for World Models / Xinyuan Chen, Haoyu Guo, Shi Guo 他
日本語で読む → - 論文ワールドモデル画像認識
表現オートエンコーダを用いたマルチプレイヤー対話型ワールドモデル
複数エージェントの行動を条件付けし、動的な物理環境をリアルタイムで生成する初のマルチプレイヤーワールドモデルを提案。ロケットリーグの10,000時間のゲームプレイで訓練し、5億パラメータの潜在拡散モデルが4人対戦を毎秒20フレームで生成する。
原題: Multiplayer Interactive World Models with Representation Autoencoders / Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary 他
日本語で読む → - 論文ワールドモデルロボティクス
ロボット描画によるロボット因子化ワールドモデル
ロボットの動作をワールドモデルから分離し、ロボットの軌道をURDFで描画して視覚入力に組み込むことで、物体の応答予測に特化した新しいワールドモデルを提案した。
原題: Robot-Factored World Models via Robot Rendering / Byungjun Kim, Taeksoo Kim, Hyunsoo Cha 他
日本語で読む → - 論文ワールドモデルロボティクス
3Dポイントワールドモデル:点群補完による高精度なダイナミクス学習
部分点群を補完してから行動条件付きダイナミクスを学習する、3D空間で動作するタスク非依存のワールドモデルを提案し、長期的なロールアウトとモデルベース計画の精度を向上させた。
原題: 3D Point World Models: Point Completion Enables More Accurate Dynamics Learning / Skand Peri, Hung Nguyen, Chanho Kim 他
日本語で読む → - 論文ワールドモデルロボティクス
GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップ
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
原題: GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation / GigaWorld Team, Angyuan Ma, Boyuan Wang 他
日本語で読む → - 論文ワールドモデル画像認識
エネルギーガイダンスだけで十分か?駆動ワールドモデルのための学習不要なノルム注入
駆動ワールドモデルの制御可能性を、拡散バックボーンの再学習なしにサンプリング時のエネルギー関数注入で実現できるかを検証した論文。軌道計画をエネルギーガイダンスで操舵できるが、映像生成との結合が課題と判明。
原題: Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models / Xiyan Su, Frank Diermeyer, Markus Lienkamp
日本語で読む → - 論文ワールドモデル画像認識
深度正則化JEPAワールドモデルによる実屋外ロボットデータからの転移可能な表現学習
実ロボットの屋外映像から学習するJEPAベースのワールドモデルに、深度を幾何学的先行知識として導入し、潜在表現の等方性を促す正則化を組み合わせることで、タスク非依存で多様かつ高エントロピーな表現を獲得し、視覚オドメトリ誤差の低減や異常検知性能の向上を実現した。
原題: Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data / Usman M. Khan
日本語で読む → - 論文ワールドモデルロボティクス
DriftWorld: ドリフトによる高速ワールドモデリング
拡散ベースのワールドモデルは推論時の反復サンプリングが遅いため、ロボットの行動計画に必要な多数のロールアウト生成がボトルネックとなる。本論文では、訓練中に行動条件付きドリフトを学習し、単一の順伝播で未来フレームを生成できるDriftWorldを提案し、拡散ベースのベースラインより平均17倍高速で、複数の操作ベンチマークで最先端の意思決定性能を達成した。
原題: DriftWorld: Fast World Modeling through Drifting / Susie Lu, Haonan Chen, Weirui Ye 他
日本語で読む → - 論文ワールドモデルロボティクス
RynnWorld-4D: ロボット操作のための4D具現化ワールドモデル
RGB、深度、オプティカルフローを統合した4Dワールドモデルを提案し、将来のシーン変化を予測してロボット操作のポリシー学習を支援する。
原題: RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation / Haoyu Zhao, Xingyue Zhao, Siteng Huang 他
日本語で読む → - 論文ビデオワールドモデル画像認識
小売業における外在視点と内在視点の基盤ビデオワールドモデル適応の比較
小売店舗の同期した外在視点・内在視点ビデオを用いて、事前学習済みビデオ拡散モデルを小売シーンに適応させる際、どの視点のデータが最も効果的かを検証した。外在視点のみの適応が、組み合わせ適応と同等以上の性能を示した。
原題: RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail / Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar 他
日本語で読む → - 論文ワールドモデル機械学習
Valdi: 価値拡散ワールドモデル
拡散モデルを用いた不確実な未来予測と、オンラインMPCのための高速な潜在計画を両立するワールドモデルを提案。CarRacing環境での予備実験により、単一拡散ステップで決定論的MLPベースラインに匹敵する性能を示した。
原題: Valdi: Value Diffusion World Models / Christopher Lindenberg, Kashyap Chitta
日本語で読む → - 論文ロボット超音波/ワールドモデル/プローブ誘導ロボティクス
ロボット超音波における目標平面プローブ誘導のための行動条件付きワールドモデル
ロボット超音波検査のプローブ誘導を、行動条件付き拡散ワールドモデルと目標条件付きトランスフォーマーを用いた2段階学習で実現した。実機実験で頸動脈70%、甲状腺65%の成功率を達成した。
原題: Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound / Siqi Fan, Mingcong Chen, Ran Liu 他
日本語で読む → - 論文ワールドモデル検証ロボティクス
夢を信じる前に検証せよ:ワールドモデルシミュレータの許容性
ロボティクスで使われるワールドモデル(WM)の信頼性を評価する枠組みを提案。視覚的忠実度だけでなく、行動への応答を検証する許容性ラダー(L0-L4)を定義し、自動運転の例で視覚品質と行動追従が逆転することを示した。
原題: Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators / Christian Oefinger, Finn Rasmus Schäfer, Korbinian Moller 他
日本語で読む → - 論文ワールドモデル機械学習
DreamForge-World 0.1 プレビュー:低計算コストでリアルタイム制御可能なワールドモデル
消費者向けGPUで動作する低計算コストのリアルタイム制御可能なワールドモデルのプレビュー版を提案し、キーボードやマウス操作によるインタラクティブなシミュレーションを実現した。
原題: DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model / Daniyel Ayupov, Artur Markov-Tsoy
日本語で読む → - 論文ワールドモデル機械学習
ワールドモデルにおける予測の経路空間定式化:単一の行動から予測・計画・不可逆性へ
AIワールドモデルの予測を、将来の軌跡上の確率測度として定式化し、予測・計画・不確実性を単一の作用汎関数の操作として統一的に扱う。学習された注意の非対称性がデータの不可逆性と関連し、不可逆性が予測の計算資源となることを示した。
原題: A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility / Gunn Kim
日本語で読む → - 論文ワールドモデル画像認識
自己進化型ワールドモデルのための反事実的制御可能性を備えた自律ビデオ生成
ビデオ生成モデルを自己進化型ワールドモデルへ発展させるため、介入条件付き未来生成、身体性制約への結合、分布シフト下での検証、生存ブランチの蒸留からなる4段階閉ループ最適化と対応する評価指標を提案した。
原題: Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models / Xin Wang, Wenxuan Liu, Tongtong Feng 他
日本語で読む → - 論文ワールドモデル機械学習
ループ型ワールドモデル
パラメータ共有のトランスフォーマーブロックを反復適用して潜在状態を精緻化する、初のループ型ワールドモデルを提案。従来比100倍のパラメータ効率と適応的計算量を実現し、反復的な潜在深度を新たなスケーリング軸として確立した。
原題: Looped World Models / Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang 他
日本語で読む → - 論文ワールドモデル画像認識
ViPSim: 視覚空間とパラメータ空間の協調による一貫した長期ホライズン身体化ワールドモデル
身体化ワールドモデルにおける低次元アクションと高次元ビデオ合成の表現ギャップを埋めるため、視覚空間(幾何学的先行知識)とパラメータ空間(数値的駆動)を協調させるフレームワークViPSimを提案し、長期ロールアウトでの軌道ドリフトやロボットと物体の相互作用の不整合を改善した。
原題: ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models / Longyu Chen, Heng Li, Wei Yang 他
日本語で読む → - 論文セキュリティ/ワールドモデルロボティクス
ロボット学習パイプラインを侵害するためのワールドモデル攻撃
ワールドモデルを介して、一見安全な遠隔操作データに悪意のあるプロンプトや遷移ダイナミクスを埋め込み、危険な合成訓練データを生成してロボットポリシーを侵害する新たなデータポイズニング攻撃手法を提案した。
原題: Targeting World Models to Compromise Robot Learning Pipelines / Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud 他
日本語で読む → - 論文ワールドモデルロボティクス
SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイム
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
原題: SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models / Ziheng He, Yixiang Chen, Ning Yang 他
日本語で読む → - 論文ビデオワールドモデル/信頼性評価画像認識
ロボトラストベンチ:ロボット操作のためのビデオワールドモデルの信頼性評価
ロボット操作におけるビデオワールドモデルの信頼性を評価するベンチマークを提案し、現行モデルが視覚的整合性はあるが制約推論や物理的相互作用に課題があることを示した。
原題: RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation / Huiqiong Li, Jiayu Wang, Zhiting Mei 他
日本語で読む → - 論文ワールドモデルロボティクス
OSCAR: ロボット工学のための全身体動作条件付きワールドモデル
ロボットのポリシー評価を可能にする、異なるロボット形態に汎化する高精度な動作条件付きビデオワールドモデルを提案した。大規模データパイプラインと2D骨格表現を用いて、実世界評価と相関する仮想評価を実現した。
原題: OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics / Zhuoyuan Wu, Jun Gao
日本語で読む → - 論文ワールドモデル画像認識
物理基盤のマルチエージェントダイナミクスベンチマーク:ワールドモデルにおける
ワールドモデルの生成するマルチエージェント衝突シナリオの物理的妥当性を評価するフレームワークCrashTwinを提案し、既存モデルが視覚品質は高いが物理法則に反する挙動を示すことを明らかにした。
原題: A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models / Nuo Chen, Lulin Liu, Zihao Li 他
日本語で読む → - 論文ワールドモデル機械学習
等変ワールドモデルのための等角軌道有効信頼地平線
既知の群対称性を持つ潜在ワールドモデルに対して、ロールアウト誤差が制御される信頼地平線を認定する手法を提案し、等変性が信頼地平線を軌道全体に輸送することを示した。
原題: Conformal Orbit-Valid Trust Horizons for Equivariant World Models / Hongbo Wang
日本語で読む → - 論文ワールドモデル/操作計画ロボティクス
EV-WM: 長期ロボット操作のためのイベント検証型ワールドモデル
事前学習済み特徴量を用いたワールドモデルの計画に、タスク進行や物理的実現性を検証する述語レベルの検証器を組み込み、長期的な操作タスクの成功率と解釈性を向上させた。
原題: EV-WM: Event-Verified World Models for Long-Horizon Robotic Manipulation / Kailin Wang, Haoxiang Jie, Yaoyuan Yan 他
日本語で読む →