論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文世界モデル画像認識
ナノ・ワールドモデル:未来動画予測のミニマル実装
拡散フォーシングを中心とした、将来のビデオ予測のためのコンパクトで再現可能なコードベースを提供し、世界モデルの設計選択を制御された方法で研究できるようにした。
原題: Nano World Models: A Minimalist Implementation of Future Video Prediction / Siqiao Huang, Partha Kaushik, Michael Chen 他
日本語で読む → - 論文視覚プランニング画像認識
パターンで考える:パターン誘導による視覚プランニングの知覚ボトルネックの打破
視覚入力からのプランニングにおけるVLMの知覚限界を、パターン誘導というオンライン帰納学習戦略で克服し、精度と効率のバランスを実現した論文。
原題: Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction / Yichang Jian, Boyuan Xiao, Zhenyuan Huang 他
日本語で読む → - 論文3D再構築/インタラクション画像認識
RHINO: 単眼ビデオからの新規物体との人間インタラクションの再構築
単眼RGBビデオから、人間、未知の操作物体、静的シーンを共通の3D世界座標で再構築する3段階フレームワークを提案。3D基盤モデルによる手がかりでSfMを安定化し、接触事前分布で物理的整合性を向上させる。
原題: RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos / Lixin Xue, Chengwei Zheng, Georgios Paschalidis 他
日本語で読む → - 論文視覚言語フォレンジクス画像認識
OmniVL-Guard Pro: ツール拡張エージェントによる包括的視覚言語フォレンジクス
閉世界前提の既存の偽造検出手法を超え、外部ツール(リアルタイム検索、拡大、セグメンテーション等)を活用するエージェントを提案し、オープンワールドでのフォレンジクス推論を実現する。
原題: OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics / Jinjie Shen, Zheng Huang, Yuchen Zhang 他
日本語で読む → - 論文画像改ざん検出画像認識
スコアベースモデルによる汎用画像改ざん位置特定
画像改ざん位置特定(IML)の汎化性能を高めるため、スコアベース生成モデルを用いたDiffIMLを提案し、マスク分布の幾何学的構造を捉えてノイズから一貫性のあるマスクを復元する。
原題: Towards Generalized Image Manipulation Localization via Score-based Model / Yunfei Wang, Bo Du, Zhe Yang 他
日本語で読む → - 論文動画偽造検出画像認識
CAM-VFD: クロスアテンションを用いたマルチモーダル動画偽造検出
外観・動き・幾何の矛盾を捉えるクロスアテンション融合により、単一モーダルでは見逃す高度な動画偽造を高精度で検出するフレームワークを提案した。
原題: CAM-VFD: Cross-Attention Multimodal Video Forgery Detection / Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy 他
日本語で読む → - 論文VLA/ベンチマーク画像認識
EPIC-Bench: 視覚言語モデルにおける細粒度な身体化視覚グラウンディングのための知覚中心ベンチマーク
身体化エージェントの視覚基盤として使われる視覚言語モデル(VLM)の、実際の環境での細かい視覚認識能力を評価するベンチマークEPIC-Benchを提案。6.6kの注釈付きデータで、対象位置特定・ナビゲーション・操作の3段階にわたる23タスクを設定し、89以上のVLMを評価した。
原題: EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models / Haozhe Shan, Xiancong Ren, Han Dong 他
日本語で読む → - 論文VLA画像認識
LASAR: 潜在認知マップによる時空間推論の実現
エージェントが空間構造の内部モデルを獲得するよう促すため、二重記憶システムと対照学習を導入し、VLN-CEやVSI-Benchで性能を向上させた。
原題: LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map / Jinzhou Tang, Sidi Liu, Waikit Xiu 他
日本語で読む → - 論文階層強化学習機械学習
階層的組合せ計画のためのマルチタイムスケール抽象化の学習
確率的組合せ最適化問題に対して、可変時間の意思決定を扱うSMDP対応の世界モデルと潜在空間ツリー探索を組み合わせたモデルベース階層強化学習手法を提案し、ベンチマークで優位性を示した。
原題: Learning Multi-Timescale Abstractions for Hierarchical Combinatorial Planning / Vivienne Huiling Wang, Tinghuai Wang, Joni Pajarinen
日本語で読む → - 論文VLA/蒸留画像認識
オフライン意味ガイダンスによる効率的な視覚言語行動ポリシー蒸留
大規模な視覚言語行動(VLA)モデルを軽量な学生ポリシーへ蒸留する際、オフラインの視覚言語モデルから高次意味情報(タスク位相アンカーや多フレーム方向記述)を教師信号として活用するフレームワークVLA-ADを提案。モデルサイズを44倍削減しつつ、教師とほぼ同等の性能を達成。
原題: Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation / Jin Shi, Brady Zhang, Yishun Lu
日本語で読む → - 論文強化学習AI
不完全な世界モデルは悪用可能である
強化学習における世界モデルの悪用可能性を定義し、報酬ハッキングとの理論的関係を明らかにした論文。
原題: Imperfect World Models are Exploitable / Logan Mondal Bhamidipaty, Esmeralda S. Whitammer, David Abel 他
日本語で読む → - 論文VLA画像認識
正しい予測、誤解を招く説明:視覚言語モデルの説明の脆弱性について
CLIPベースの視覚言語モデルにおいて、予測を変えずに説明ヒートマップを操作できる攻撃手法X-Shiftを提案し、説明の忠実性と予測の乖離を実証した。
原題: Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations / Narges Babadi, Hadis Karimipour
日本語で読む → - 論文3D世界モデリング画像認識
WorldAct: モノリシックな3D世界をインタラクティブ対応のオブジェクト中心シーンへ変換
生成された静的な3D世界を、編集可能で物理インタラクション可能なオブジェクト中心のシーンに変換するフレームワークを提案。
原題: WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes / Jichen Hu, Jiawei Guo, Jiazhong Cen 他
日本語で読む → - 論文ネットワークアーキテクチャcs.NI
共有繁栄インターネット
自動化とAIの恩恵を社会全体に広く届けるためのネットワークコンピューティングアーキテクチャを提案し、物理的制約から設計原則と技術的柱を導出し、具体的なユースケースと測定可能な成果を定義した論文。
原題: The Shared Prosperity Internet / Juan A. Cabrera, Pit Hofmann, Jonas Schulz 他
日本語で読む → - 論文ワールドモデル機械学習
ワールドモデルのための識別可能なトークン対応付け
トークンベースのトランスフォーマーワールドモデルにおける長期的な時間的不整合(物体の重複や消失など)を解決するため、次フレーム予測を構造化割り当て問題として定式化し、各トークンを前フレームからのコピーか新規生成かで対応付ける復号ステップを提案した。
原題: Identifiable Token Correspondence for World Models / Youngin Kim, Ray Sun, Inho Kim 他
日本語で読む → - 論文意味通信/デジタルツイン機械学習
物理AIシステムにおける意味通信のためのワールドモデル対応因果デジタルツイン
閉ループ物理AIシステム向けに、長期的なリターン最大化を目指す意味通信の枠組みを提案。因果情報価値指標とワールドモデル対応因果デジタルツインを用いて、セマンティックトークンの選択と制御ポリシーを学習する。
原題: World Model-Enabled Causal Digital Twins for Semantic Communications in Physical AI Systems / Lingyi Wang, Tingyu Shui, Walid Saad 他
日本語で読む → - 論文VLA画像認識
UAM: VLA訓練における忘却問題への二経路視点からのアプローチ
VLAモデルがVLMのマルチモーダル能力を失う「身体化税」問題を、生物学的視覚の二経路構造に着想を得て、並列な背側経路(Dorsal Expert)を追加するUAMを提案し、忘却を抑えつつ操作性能を向上させた。
原題: UAM: A Dual-Stream Perspective on Forgetting in VLA Training / Jianke Zhang, Yuanfei Luo, Yucheng Hu 他
日本語で読む → - 論文時系列予測機械学習
カオス理論的バランスと潜在ダイナミクスによる生理信号のワールドモデリングに向けて
生理時系列信号を潜在空間で表現し、臨床介入を条件とした長期予測を行うワールドモデルNormWear-2を提案。カオス理論に基づくデータバランス手法により、より少ないデータで頑健な表現を獲得する。
原題: Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics / Yunfei Luo, Xi Chen, Yuliang Chen 他
日本語で読む → - 論文医療AI/LLMエージェントAI
臨床世界モデルとの対話によるLLM内の患者動態のエージェント化
敗血症治療の逐次意思決定を改善するため、臨床世界モデルで患者反応をシミュレートし、提案・シミュレート・修正の流れで処方を決定するLLMエージェントSepsisAgentを導入。3段階カリキュラムで訓練し、MIMIC-IVデータで既存手法を上回る性能と安全性を達成した。
原題: Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model / Minghao Wu, Yuting Yan, Zhenyang Cai 他
日本語で読む → - 論文3D編集/安全性cs.GR
3DEditSafe: 3D編集パイプラインを安全でない生成から守る
3Dガウシアンスプラッティングを用いたテキスト駆動の3D編集において、不適切なプロンプトが安全でないコンテンツを生成するリスクを指摘し、それを防ぐ安全正則化フレームワークを提案した。
原題: 3DEditSafe: Defending 3D Editing Pipelines from Unsafe Generation / Nicole Meng, Zheyuan Liu, Meng Jiang 他
日本語で読む → - 論文動画生成画像認識
PanoWorld: 幾何学的に一貫したパノラマ動画の世界モデリング
単一画像とキャプションから、3Dシーン状態を明示的に考慮した幾何学的に一貫した360度動画を生成する世界モデルを提案。深度と軌跡の一貫性を保つ軽量正則化を導入し、専用データセットで評価した。
原題: PanoWorld: Geometry-Consistent Panoramic Video World Modeling / Le Jiang, Xiangyu Bai, Bishoy Galoaa 他
日本語で読む → - 論文VLA画像認識
二重ボトルネックの打破:統一マルチモーダルモデルを自己適応型インターリーブ視覚推論器へ進化させる
理解と生成のギャップによるX2Iタスクの二重ボトルネック(注意の絡まりと視覚的洗練不足)を解決するため、指示の複雑さに応じて生成戦略を自律的に切り替えるフレームワークを提案した。
原題: Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners / Qingyang Liu, Bingjie Gao, Canmiao Fu 他
日本語で読む → - 論文ビデオ生成RL画像認識
CreFlow: スパース報酬の身体化ビデオ拡散強化学習のための修正リフロー
ビデオ生成モデルを強化学習で微調整する際、線形時相論理に基づく報酬モデルと、報酬関連領域のみを更新する新しい枠組みを提案し、操作タスクの成功率を向上させた。
原題: CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL / Zhenyang Ni, Yijiang Li, Ruochen Jiao 他
日本語で読む → - 論文探索physics.app-ph
移動ペナルティ付きベイズ最適化による放射性線源探索
放射性線源を効率的に探索するため、不均一分散ガウス過程を用いたベイズ最適化戦略を提案し、移動コストを考慮して探索と活用のバランスを取る。シミュレーションで有効性を実証した。
原題: Radioactive Source Seeking using Bayesian Optimisation with Movement Penalty / Lysander Miller, Joshua Keene, Jeremy M. C. Brown 他
日本語で読む → - 論文映像理解画像認識
Minerva-Ego: 自己中心映像理解のための時空間ヒント
自己中心視点の映像理解における複雑な推論を評価するベンチマークを新たに構築し、最先端モデルが人間に及ばないことを示すとともに、時空間ヒントを与えることで性能が向上することを明らかにした。
原題: Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding / Arsha Nagrani, Jasper Uijilings, Shyamal Buch 他
日本語で読む → - 論文人-物体インタラクション/物理シミュレーション画像認識
HOIにおけるReal2Sim:単眼ビデオからの物理的に妥当な人-物体インタラクション再構成に向けて
単眼ビデオから人と物体のインタラクションを再構成する際、視覚的にだけでなく物理的にも妥当な4Dアニメーションを生成するフレームワークHA-HOIを提案する。人間の動きを基準に物体を追従させ、物理シミュレーションで安定した動作を実現する。
原題: Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos / Yubo Zhao, Yujin Chai, Yunao Dong 他
日本語で読む → - 論文機械学習忘却画像認識
ICED: 解釈可能な概念分解による概念レベルの機械学習忘却
視覚言語モデルにおいて、画像内の複雑に絡み合った概念を分解し、対象概念のみを選択的に忘却する概念レベルの機械学習忘却フレームワークを提案した。
原題: ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition / Shen Lin, Jing Lin, Junhao Dong 他
日本語で読む → - 論文計画/ベンチマークAI
Ego2World: 一人称調理動画を実行可能な世界へ変換し信念状態計画を行う
一人称調理動画から実行可能なシンボリック世界を構築し、部分観測下での信念状態計画を評価するベンチマークを提案した論文。
原題: Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning / Qinchuan Cheng, Zhantao Gong, Pengzhan Sun 他
日本語で読む → - 論文解釈可能性機械学習
トランスフォーマーは高度に構造化された世界モデルを線形に表現する
数独の解法トレースで訓練したトランスフォーマーの内部表現を解析し、セル単位ではなく行・列・ボックス単位で世界モデルを構築し、最終MLP層に特定セルの候補が1つに絞られたことを検出する専用ニューロン群(裸のシングル回路)が存在することを発見した。
原題: Transformers Linearly Represent Highly Structured World Models / Roman Kniazev, Nathanaël Fijalkow
日本語で読む → - 論文世界モデル機械学習
言語モデルの事前知識を用いた観測からのPOMDP世界モデル学習
LLMが少数の観測・行動軌跡からPOMDPモデルを提案・反復改良し、信念ベースの尤度を最適化することで、部分観測環境でのサンプル効率的な世界モデル学習を実現した。
原題: Learning POMDP World Models from Observations with Language-Model Priors / Valentin Six, Frederik Panse, Mathis Fajeau 他
日本語で読む →