論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/9 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御制御
フォールトを考慮したロボット群通信スケジューリングのためのMPC
断続的な通信環境下でロボット群を運用する際、限られた通信機会をどう割り当てるかという問題に対し、故障モードの曖昧性を確率的に扱うIMM-MPCというモデル予測制御手法を提案し、致命的故障の早期発見率を大幅に向上させた。
原題: Fault-Aware MPC for Robotic Fleet Communications Scheduling / Carlo Schreiber, Duncan Eddy, Mykel J. Kochenderfer
日本語で読む → - 論文ワールドモデル機械学習
Atariにおけるデータ効率的な汎用トランスフォーマーワールドモデルに対するスケールの影響の調査
Atari 100kベンチマークで、最小限のトランスフォーマーワールドモデルを用いて、モデル規模が環境ごとに異なるスケーリング挙動を示すことを明らかにし、統合トレーニングがスケーリングダイナミクスを安定化させることを実証した。
原題: Probing the Impact of Scale on Data-Efficient, Generalist Transformer World Models for Atari / Jooyeon Kim
日本語で読む → - 論文分子最適化機械学習
MolWorld: 作用可能な分子最適化のための分子ワールドモデル
分子最適化において、既知分子から局所的な構造変換で到達可能な候補を生成するため、分子移動グラフを逐次拡張するワールドモデルを提案した。
原題: MolWorld: Molecule World Models for Actionable Molecular Optimization / Yang Qiao, Bo Pan, Hao-Wei Pang 他
日本語で読む → - 論文意思決定支援AI
三合一世界モデル:マーケティング介入のためのエネルギーベース整合性、予測、反事実推論
マーケティング介入の効果を評価するため、Deep Boltzmann Machineで潜在信念を学習し、同じ信念から予測と反事実推論を行う統一アーキテクチャを提案した。
原題: Three-in-One World Model: Energy-Based Consistency, Prediction, and Counterfactual Inference for Marketing Intervention / Junichiro Niimi
日本語で読む → - 論文状態推定制御
一般化Persidskiiダイナミクスによる非線形システムの安定性保証付きKoopmanオブザーバ設計
Koopman作用素で近似された非線形システムに対し、誤差ダイナミクスを一般化Persidskii系として捉え、LMIでゲインを設計することで入力対状態安定性を保証する非線形オブザーバを提案した。
原題: Stability-Certified Koopman Observer Design for Nonlinear Systems via Generalized Persidskii Dynamics / Syed Pouladi
日本語で読む → - 論文世界モデル機械学習
LaWM: 最小作用世界モデルによる視覚観測からの長期物理整合性
視覚観測から学習する潜在世界モデルにおいて、最小作用の原理を潜在空間で実装し、将来の状態遷移を離散変分積分器で決定することで、長期ロールアウトの物理的整合性を向上させる手法を提案した。
原題: LaWM: Least Action World Models for Long-Horizon Physical Consistency from Visual Observations / Qixin Xiao, Maani Ghaffari
日本語で読む → - 論文世界モデル/計画機械学習
予測はできるが計画はできない:潜在世界モデルのための到達可能性補助目的
潜在世界モデルが短期的予測は正確でも計画に適さない潜在空間を持つ問題を指摘し、時間軸と空間軸の両方で計画整合的な監視を追加する軽量な補助目的(RC-aux)を提案した。
原題: Predictive but Not Plannable: RC-aux for Latent World Models / Wenyuan Li, Guang Li, Keisuke Maeda 他
日本語で読む → - 論文VLA画像認識
ForgeVLA: 言語アノテーションなしの連合視覚言語行動学習
分散した視覚・行動ペアから、言語アノテーションやデータ集約なしにVLAモデルを学習する連合学習フレームワークを提案した。
原題: ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations / Yuhao Zhou, Yunpeng Zhu, Yang Zhou 他
日本語で読む → - 論文電動駆動系/農業機械制御
自走式農業機械・機器キャリア向け電動アクスル・ホイールモジュール駆動系コンセプト
自走式農業機械やフィールドロボット向けに、電動アクスルモジュールとホイールモジュールの2つの駆動系コンセプトを比較し、設計自由度や効率、コストなどの要件に対する利点を評価した論文。
原題: Electric Axle and Wheel Module Driveline Concepts for Self-propelled Agricultural Machinery and Equipment Carriers / Timo Oksanen, Karl Th. Renius
日本語で読む → - 論文手のポーズ予測画像認識
EggHand: 自己中心視点の手のポーズ予測のためのマルチモーダル基盤モデル
自己中心視点のビデオから将来の3D手のポーズ系列を予測する基盤モデルを提案し、VLAモデルの行動デコーダと自己中心ビデオテキストエンコーダを統合して、動き・文脈・意図を共同推論する。EgoExo4Dデータセットで最先端の精度を達成し、言語プロンプトによる制御可能な予測も可能にした。
原題: EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting / Jaeyoung Choi, Hyeondong Kim, Yujin Kim 他
日本語で読む → - 論文LLMエージェント自然言語
MANTRA: ツール使用LLMエージェント向けSMT検証済みコンプライアンスベンチマークの合成
自然言語の手順書とツールスキーマから、SMTソルバーで検証されたコンプライアンスベンチマークを自動生成するフレームワークMANTRAを提案。
原題: MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents / Ashwani Anand, Ivi Chatzi, Ritam Raha 他
日本語で読む → - 論文状態推定制御
積リー群上の可観測性と推定における時空間ダイバーシティ
積リー群上の結合動的システムにおける状態推定のための時空間ダイバーシティの枠組みを構築し、可観測性の条件や空間ダイバーシティ飽和定理を導出した。SE(2)およびSE(3)ナビゲーションに適用し、冗長・非冗長センサ構成の可観測性保証を与える。
原題: Space-Time Diversity in Observability and Estimation on Product Lie Groups / Somasundhar Venkatasubramanian, Anirudh Venkat, Advaidh Venkat
日本語で読む → - 論文強化学習機械学習
複雑なカードゲームのための因果強化学習:マジック・ザ・ギャザリングのベンチマーク
因果強化学習のための複雑なベンチマークとして、マジック・ザ・ギャザリングを用いた環境を構築し、因果構造を活用するエージェントを提案・評価した。
原題: Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark / Cristiano da Costa Cunha, Ajmal Mian, Tim French 他
日本語で読む → - 論文強化学習機械学習
基礎方針を用いた多段階計画のための到達時間同型性
オフライン強化学習において、到達時間観測から制御マルコフ過程の有向時間幾何を復元する新しい作用素論的表現学習フレームワークを提案し、基礎方針学習アルゴリズムIELを開発した。
原題: Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies / Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok 他
日本語で読む → - 論文モデルベース強化学習AI
AGWM: 構成的前提条件を持つ環境のためのアフォーダンス基盤世界モデル
行動の実行可能性を左右する前提条件をDAGで明示的に追跡する世界モデルを提案し、多段階予測誤差の低減と解釈性向上を実証した。
原題: AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites / Qinshi Zhang, Weipeng Deng, Zhihan Jiang 他
日本語で読む → - 論文世界モデル/強化学習AI
マスク拡散言語モデルはエージェント強化学習のための強力で制御可能なテキストベース世界モデルである
テキストベースの世界モデルを、初期状態やタスク文脈などの要素に分解し、マスク拡散言語モデルが自己回帰モデルより優れた一貫性と多様性を持つことを示し、強化学習の訓練環境として有効なフレームワークを提案した。
原題: Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL / Darshan Deshpande
日本語で読む → - 論文医療ロボティクス制御
キリガミ構造電子カプセルによる長期連続胃内モニタリング
胃内に長期滞在可能な飲み込み型ロボットプラットフォームを開発し、キリガミ構造の電子回路と電気的トリガーによる分解機構を統合して、1週間以上の連続モニタリングを実現した。
原題: Kirigami-Structured Electronic Capsule for Long-Term Continuous Gastric Monitoring / Hen-Wei Huang, Claas Ehmke, Dawei Wang 他
日本語で読む → - 論文因果推論機械学習
大域単調性を超えた反事実的識別可能性:非単調三角構造因果モデル
因果推論における反事実の識別可能性を、大域単調性を仮定せずに達成するための構造条件を提案し、ロボット操作タスクでの有効性を示した論文。
原題: Counterfactual identifiability beyond global monotonicity: non-monotone triangular structural causal models / Pengcheng Tan, Jiang Chen, Dehui Du
日本語で読む → - 論文表現学習機械学習
予測と因果のギャップ:不可能性定理と大規模ニューラル証拠
予測表現学習が環境ではなくシステムを捉えるべきところ、環境を優先してしまう系統的な失敗モードを発見し、その構造的原因を理論と大規模実験で示した論文。
原題: The Predictive-Causal Gap: An Impossibility Theorem and Large-Scale Neural Evidence / Kejun Liu
日本語で読む → - 論文歩行機械学習
隠れ状態は価値勾配である:リカレント方策のポントリャーギン構造
リカレント方策の隠れ状態がポントリャーギンの最小原理における随伴状態(価値関数の勾配)として解釈できることを示し、それを活用した随伴損失で歩行タスクの方策を改善した。
原題: Hidden States as Value Gradients: The Pontryagin Structure of Recurrent Policies / David Leeftink, Max Hinne, Marcel van Gerven
日本語で読む → - 論文言語モデル機械学習
言語モデルの出力分布サンプリングによる誤差と内部状態の幾何学的関係
GPT型言語モデルが多様なトークンに確率が分散する生成点で単一トークンの変化に敏感であることを幾何学的性質として捉え、トークン埋め込みの幾何のみに依存する1形式を導出。その曲率がチェス推論タスクで意味的に世界モデルと結びつくことを示した。
原題: A geometric relation of the error introduced by sampling a language model's output distribution to its internal state / Albert F. Modenbach
日本語で読む → - 論文言語モデル自然言語
Gyan: 説明可能なニューロシンボリック言語モデル
トランスフォーマーに依存しない新しいアーキテクチャを用いた説明可能な言語モデルを提案し、複数のデータセットでSOTA性能を達成した。
原題: Gyan: An Explainable Neuro-Symbolic Language Model / Venkat Srinivasan, Vishaal Jatav, Anushka Chandrababu 他
日本語で読む → - 論文3Dアセット生成画像認識
PhysForge: 物理に基づくインタラクティブな仮想世界向け3Dアセット生成
物理的に正しい3Dアセットを生成するための2段階フレームワークを提案。VLMが物理設計図を作成し、拡散モデルが形状と運動学パラメータを生成する。
原題: PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World / Yunhan Yang, Chunshi Wang, Junliang Ye 他
日本語で読む → - 論文解釈可能性機械学習
多様体ステアリングが明らかにするニューラルネットワーク表現と行動の共有幾何学
ニューラルネットワークの活性化空間の幾何学的構造に沿って介入(ステアリング)することで、モデルの自然な行動軌道を再現できることを示し、表現の幾何学と行動の因果関係を明らかにした。
原題: Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior / Daniel Wurgaft, Can Rager, Matthew Kowal 他
日本語で読む → - 論文VLAcs.GR
JoyAI-Image: 統一マルチモーダル理解と生成における空間知能の覚醒
視覚理解・テキストからの画像生成・指示による画像編集を統合したマルチモーダル基盤モデルを提案し、空間認識能力を強化した。
原題: JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation / Lin Song, Wenbo Li, Guoqing Ma 他
日本語で読む → - 論文安全制御制御
共形予測によるリスク認識ナビゲーションのための微分可能最適化階層型安全制御
未知環境での自律走行のリスク認識ナビゲーションのために、共形予測で不確実性を扱い、微分可能な最適化層で制御障壁関数を構築する安全制御手法を提案した。
原題: Differentiable Optimization Layered Safety-Critical Control for Risk-Aware Navigation via Conformal Prediction / Jinyang Dong, Shizhen Wu, Yongchun Fang
日本語で読む → - 論文強化学習機械学習
大規模言語モデルによる強化学習インターフェースの発見
強化学習のタスク設定に必要な観測と報酬のインターフェースを、大規模言語モデルを用いた進化的フレームワークLIMENで自動生成する手法を提案した。
原題: Discovering Reinforcement Learning Interfaces with Large Language Models / Akshat Singh Jaswal, Ashish Baghel, Paras Chopra
日本語で読む → - 論文マルチモーダル画像認識
大規模基盤モデルにおける音声視覚知能
音声と視覚の統合的理解・生成・対話を大規模基盤モデルの観点から体系的に整理した初のサーベイ論文。
原題: Audio-Visual Intelligence in Large Foundation Models / You Qin, Kai Liu, Shengqiong Wu 他
日本語で読む → - 論文世界モデル機械学習
観察から世界を理論化する学習
観察データから明示的な説明理論を推論する学習パラダイムを提案し、潜在プログラムを誘導して実行する確率的ニューラルモデルを導入した。
原題: Learning to Theorize the World from Observation / Doojin Baek, Gyubin Lee, Junyeob Baek 他
日本語で読む → - 論文点群解析画像認識
近傍均質性制約を用いたチャネルレベル関係の注意集約による点群解析
点群解析において、チャネルレベルの関係性と近傍均質性を利用した新しい注意集約機構を提案し、既存の空間・チャネル注意機構の情報損失を軽減して精度を向上させた。
原題: Channel-Level Relation to Attentive Aggregation with Neighborhood-Homogeneity Constraint for Point Cloud Analysis / Jiaqi Shi, Jin Xiao, Xiaoguang Hu 他
日本語で読む →