論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/15 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文世界モデル機械学習
SIGReg目的関数の変分自由エネルギーとしての理論的能動推論的解釈:JEPA世界モデルの説明
JEPAの訓練目的関数が能動推論の変分自由エネルギーとして有効である条件を理論的に示し、正則化子の選択がその妥当性を決めることを明らかにした。
原題: The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models / Fabio Arnez, Alexandra Gomez-Villa
日本語で読む → - 論文画像生成画像認識
FreeLit: 物理ガイド拡散によるペアなし屋内再照明
屋内シーンの再照明を、ペアデータなしで光源位置・色・強度を制御可能にするフレームワークを提案。物理的先行知識と拡散モデルを組み合わせ、不安定な内在推定を安定化する。
原題: FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion / Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang 他
日本語で読む → - 論文説明可能AI機械学習
局所加法的特徴帰属:数学的分類法と報告チェックリスト
局所加法的特徴帰属手法を共通の枠組みで整理し、5つの仕様選択と公理による比較、失敗モードの関連付け、10項目の報告チェックリストを提案したサーベイ論文。
原題: Local Additive Feature Attribution: A Mathematical Taxonomy and Reporting Checklist / Rebecca Afriyie Sarpong, Daniel Commey
日本語で読む → - 論文計画/LLMAI
検証済みワールドモデルが依然として負けるとき:LLM合成コードワールドモデルにおけるプレイ適合性と予測精度
LLMが生成したゲームルールのコードワールドモデルが、遷移精度100%でも計画時に重要な動的規則を欠落させ、プレイで負けることを示し、その危険性を定量化する法則を導出した。
原題: When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models / Javier Aguilar Martín
日本語で読む → - 論文モデルベースRL機械学習
RENEW: 選好から世界モデルの学習とモデル悪用の修復を目指して
オフライン強化学習の世界モデルがデータの薄い領域で幻覚を起こす問題に対し、人間の選好を利用してモデルのダイナミクスを直接修正する手法を提案した。不確実性に基づく効率的な微調整により、サンプル効率を改善し、破滅的忘却を抑える。
原題: RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences / Logan Mondal Bhamidipaty, Mykel Kochenderfer, Subramanian Ramamoorthy
日本語で読む → - 論文教育ロボティクスAI
Earthquaker-AI:小学校向け地震教育のためのルーブリック評価を備えた検索拡張生成フレームワーク
地震防災教育用のロボットプロジェクトに、検索拡張生成(RAG)による対話型AIアシスタントを統合し、学年に応じたルーブリック評価で自己調整学習を支援する教育フレームワークを提案した論文。
原題: Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake Education / Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou 他
日本語で読む → - 論文3Dシーン理解画像認識
GPOcc++: 視覚幾何学事前情報を用いた統合スパースガウス占有予測
視覚幾何学の事前情報を占有予測に適したスパースガウス表現に変換し、多視点・時系列を統一的に扱う3Dシーン理解手法GPOcc++を提案した。屋内・屋外のベンチマークで高い性能と効率性を示した。
原題: GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors / Changqing Zhou, Yueru Luo, Yulan Guo 他
日本語で読む → - 論文音楽可視化画像認識
音楽を地平線へ:音楽駆動型360度動画生成
音楽の感情軌跡を推定し、それを視覚ガイダンスに変換して360度の没入型ミュージックビデオを生成するパイプラインを提案した。
原題: Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation / Kai Hsu Tsai, Yong Wei Fu, Hung I Yang 他
日本語で読む → - 論文GUIエージェント自然言語
KnowAct-GUIClaw:深く理解し完璧に行動する、自己進化するメモリとスキルを備えたパーソナルGUIアシスタント
OpenClawのGUI操作と自己進化の欠陥を解決するため、Know-Route-Act-Reflectフレームワークを備えたKnowAct-GUIClawを提案し、クロスプラットフォームでのタスク自動化の効率と精度を向上させた。
原題: KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill / Yunxin Li, Jinchao Li, Shibo Su 他
日本語で読む → - 論文セグメンテーション/知識蒸留画像認識
MobileSAM2: 空間知能のための軽量セグメント・エニシング
SAM2をモバイル端末で動作するよう軽量化したモデルを提案。ハイパーグラフを用いた知識蒸留法HyperKDを導入し、画像・動画のセグメンテーション性能を保ちつつ効率化を実現した。
原題: MobileSAM2: Lightweight Segment Anything for Spatial Intelligence / Kai Jiang, Jiaxing Huang, Jingyi Zhang 他
日本語で読む → - 論文視覚場所認識画像認識
既視感を打ち破る:視覚言語推論による視覚場所認識の独立監査
視覚場所認識の結果を、視覚言語モデルを用いて独立に検証する新しい監査フレームワークを提案し、誤受理率を低減しつつ再現率を向上させた。
原題: Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning / Sania Waheed, Michael Milford, Sarvapali D. Ramchurn 他
日本語で読む → - 論文4D時空間推論画像認識
DynTrace: 4D時空間推論のための動的物体証跡追跡
MLLMの4D時空間推論を強化するため、トレーニング不要のフレームワークDynTraceを提案。動的軌跡可視化と動的トレーストークンで物体の動きを連続追跡し、カメラ運動と物体運動を分離する。
原題: DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs / Rongxin Gao, Yuzhi Huang, Dongxuan Liu 他
日本語で読む → - 論文強化学習AI
人間の選好と正当化に基づくワールドモデルを用いた安全なエージェント行動の学習
未知の環境で報酬関数が使えない安全重視のタスクに対し、人間の選好とその理由(正当化)を活用して報酬モデルを学習し、ワールドモデルとモデル予測制御で安全な方策を直接展開する手法DROPJを提案した。
原題: Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models / Ilias Kazantzidis, Timothy J. Norman, Yali Du 他
日本語で読む → - 論文3D言語フィールド/オブジェクト検索画像認識
SaaF: シーン特化型の曖昧性を考慮した3D言語フィールドによる実世界オブジェクトの対話的検索
実世界のシーンで自然言語による対話的なオブジェクト検索を行うため、ガウススプラッティングベースの3D言語フィールドを提案。メトリック学習でインスタンス識別性を高め、曖昧なクエリに対して明確化を求める機能を備える。
原題: SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval / Yuga Yano, Daiju Kanaoka, Hakaru Tamukoh 他
日本語で読む → - 論文ディープフェイク検出画像認識
継続進化型ディープフェイク検出:動的検出システムのアーキテクチャと公開ベンチマーク評価
静的検出器の実世界での性能低下を指摘し、継続的に学習データを更新する敵対的競争で訓練されたディープフェイク検出システムBMFを提案・評価した論文。
原題: Continuously Evolving Deepfake Detection: An Architecture and Public-Benchmark Evaluation of a Dynamic Detection System / Ken Jon Miyachi, Dylan Uys
日本語で読む → - 論文ナビゲーション機械学習
音声視覚ナビゲーションのためのハイブリッドMamba
従来のCNNやRNNに代わり、Mambaベースのエンコーダを用いて音声と視覚の動的マルチモーダル系列を効率的に表現し、ナビゲーション成功率を大幅に向上させた。
原題: A Hybrid Mamba for Audio-Visual Navigation / Yi Wang, Yinfeng Yu
日本語で読む → - 論文ベンチマーク画像認識
空間における自己:UAV具現化知能における自己認識と空間認知のベンチマーク
UAVの具現化知能における自己認識と空間認知を評価するベンチマークSIS-Benchを提案し、既存のMLLMが自己認識と空間認知のバランスに欠けることを示した。
原題: Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence / Zhishan Zou, Guoyan Sun, Zhiwei Wei 他
日本語で読む → - 論文内視鏡/3D再構成画像認識
ExtraGS: 拡散ガイドによる3Dガウススプラッティングを用いた内視鏡視野外挿の強化
内視鏡映像から3Dシーンを再構成し、視野外の解剖学的構造を拡散モデルで補完することで、内視鏡の視野外挿を高精度化するフレームワークを提案した。
原題: ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting / Cheng-Tai Hsieh, Jiwei Shan, Han Fang 他
日本語で読む → - 論文群制御cs.MA
幅、メモリ、遅延:フラットなマルチエージェントシステムの限界に関する資源会計
フラットなマルチエージェントシステムの性能限界は階層構造ではなく、エージェント数、内部モデルのメモリ、観測遅延という3つの資源で決まることを、正確に計算可能な最適解を持つテストベッドで示した論文。
原題: Width, Memory, and Delay: A Resource Accounting for the Limits of Flat Multi-Agent Systems / Oleksandr Kuznetsov, Emanuele Frontoni
日本語で読む → - 論文自動運転/意思決定ロボティクス
自動運転の追い越しにおけるリスク認識意思決定:ワールドモデルベースのMixture-of-Expertsフレームワーク
高速道路での自動追い越しにおいて、ワールドモデルを用いた並列マルチステップ展開と階層的ゲーティング機構により、長期的リスクを考慮した安全な意思決定を実現するフレームワークを提案した。
原題: Risk-Aware Decision-Making for Autonomous Overtaking: A World Model-Based Mixture-of-Experts Framework / Yongzhi Liu, Sunan Zhang, Jinchang Xu 他
日本語で読む → - 論文群制御AI
ネットワーク型知能:人間とAIのチーム科学のための能動的共有コンテキストグラフ
科学チームの協調を支援するため、研究者とAIエージェントの間で観察や仮説を自動的に共有・ルーティングする能動的共有ワークスペース「Mycelium」を提案し、実データ解析での有効性を示した。
原題: Networked Intelligence: Active Shared Context Graphs for Human-AI Team Science / Sutanay Choudhury, Jeffrey J. Czajka, Lummy M. O. Monteiro 他
日本語で読む → - 論文VLA画像認識
Hy-Embodied-VLM-1.0:効率的な物理世界エージェント
物理世界で動作する組み込みエージェント向けの基盤モデルを提案し、行動中心の能力分類に基づくデータパイプラインと効率的なMoEアーキテクチャにより、38ベンチマークで優れた性能を達成した。
原題: Hy-Embodied-VLM-1.0: Efficient Physical-World Agents / Ziyi Wang, Xumin Yu, Yongming Rao 他
日本語で読む → - 論文感情認識AI
本当に1Bパラメータ超のマルチモーダル感情言語モデルが必要なのか?
大規模マルチモーダル感情認識モデルは高性能だが計算コストが高い。本論文では、知識蒸留により軽量なサブ10億パラメータの学生モデルに知識を転移し、効率的で高性能な感情認識を実現するLight-MERを提案する。
原題: Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters? / Kaiwen Zheng, Junchen Fu, Wenhao Deng 他
日本語で読む → - 論文視覚推論画像認識
UniVR: 視覚空間での思考による統合視覚推論
純粋な視覚デモから複雑な推論、物理ダイナミクス、長期計画を同時に学習する最初の試みで、新しい強化学習手法と大規模ベンチマークを導入し、視覚空間内での推論の可能性を示した。
原題: UniVR: Thinking in Visual Space for Unified Visual Reasoning / Zhongwei Ren, Yunchao Wei, Yao Zhao 他
日本語で読む → - 論文適応制御制御
システム自己をデータ構造として捉える:境界適応へのアーキテクチャ的アプローチ
システム自身のアーキテクチャをグラフとして明示的に表現し、運用中にその構造を考慮して適応を行う手法を提案。センサドリフトやアクチュエータ故障時に、固定アーキテクチャでは追従誤差が最大24mに達するのに対し、提案手法では1.5m未満に抑えられることを示した。
原題: System-Self as a Data Structure: An Architectural Approach to Bounded Adaptation / Erwin Franz, Alhassan S. Yasin
日本語で読む → - 論文ナビゲーション/敵対的攻撃AI
AdvNav: 行動誘導型ブラックボックス敵対的攻撃による視覚言語ナビゲーションの妨害
視覚言語ナビゲーションシステムに対する、勾配情報を使わずにエージェントの行動観測のみで敵対的摂動を生成するブラックボックス攻撃フレームワークを提案した。
原題: AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation / Chenyang Li, Kaige Li, Zeyu Jiang 他
日本語で読む → - 論文群制御制御
関与度を考慮したLLMエージェントによる追跡回避
LLMプランナが役割を割り当て、MPCとCBFで各ロボットを制御する階層型マルチエージェント追跡回避フレームワークを提案し、チーム行動の適応性を評価した。
原題: Engagement-Aware Agentic Pursuit-Evasion / Ananya Acharya, Trenton Goyette, Masoud Ataei 他
日本語で読む → - 論文自動運転機械学習
LIDAR-AD: 行動残差連鎖を用いたデコーダーフリー潜在相互作用ドリーマーによる自動運転
自動運転のための潜在世界モデルを改良し、観測再構成をやめて冗長性を削減した潜在整列と、行動を残差更新としてモデル化する手法を提案し、長期的な閉ループ意思決定の性能を向上させた。
原題: LIDAR-AD: A Decoder-Free Latent-Interaction Dreamer with Action-Residual Chains for Autonomous Driving / Yongzhi Liu, Yang Xiao, Zhong Cao 他
日本語で読む → - 論文VLA画像認識
複雑な組立動作理解のための構成文脈ファインチューニングによる視覚言語モデル
組立動作を動詞・対象・工具の要素に分解し、視覚言語モデルを要素ごとにファインチューニングして、ビデオから組立動作を高精度に認識する手法を提案した。
原題: Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos / Hao Zheng, Jinyi Huang, Tiantian Zheng 他
日本語で読む → - 論文プライバシー保護画像認識
DiffUE: 拡散オートエンコーダによる非学習可能例の実用性と非学習性のトレードオフ向上
画像のピクセル空間ではなく意味空間にノイズを注入することで、視覚品質を保ちながら敵対的訓練などの再学習戦略に耐性を持つ非学習可能例を生成する手法を提案した。
原題: DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders / Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik 他
日本語で読む →