論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/23 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文敵対的攻撃画像認識
GeoThreat: リモートセンシング画像解釈のための大規模視覚言語モデルに対する転移可能な標的型敵対的攻撃
リモートセンシング画像解釈における大規模視覚言語モデル(LVLM)への転移可能な標的型敵対的攻撃手法GeoThreatを提案。概念レベルと知覚レベルの両方で敵対的表現を調整し、ブラックボックス設定でのセマンティック操作を実現する。
原題: GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation / Yimin Fu, Yuefeng Bai, Baicheng Pan 他
日本語で読む → - 論文オフラインRL/データ削除機械学習
TOUR: オフライン強化学習のための軌跡レベル忘却ベンチマーク
オフライン強化学習における軌跡レベルのデータ削除を評価するベンチマークTOURを提案し、既存の削除手法が環境依存でプライバシーと有用性のトレードオフが異なることを示した。
原題: TOUR: A Trajectory-Level Unlearning Benchmark for Offline Reinforcement Learning / Chaofan Pan, Lingfei Ren, Xiangyu Jiang 他
日本語で読む → - 論文強化学習AI
環境・エージェント・結合系のワールドモデル
モデルベース強化学習におけるワールドモデルを、予測するチャネル(環境、エージェント、結合系)に基づいて分類し、計算力学を用いて各チャネルの正準モデルを定義した。
原題: World models of environment, agent and joint agent-environment systems / Manuel Baltieri, Filippo Torresan, Yivan Zhang 他
日本語で読む → - 論文遠隔操作/強化学習制御
関節柔軟性と時間変動遅延を有する遠隔操作マニピュレータの制御における適応ゲイン調整のための深層強化学習
関節の柔軟性と時間変動する通信遅延を持つ遠隔操作システムに対し、安定なP+dコントローラとTD3強化学習エージェントを組み合わせ、遠隔側の比例・減衰ゲインをリアルタイム調整して振動低減と追従性能向上を実現した。
原題: Deep Reinforcement Learning for Adaptive Gain Tuning in Control of Teleoperation Manipulators with Joint Flexibility and Time-Varying Delays / Armin Attarzadeh, Mohammad Ali Ghaemifar, Alireza Khanzadeh 他
日本語で読む → - 論文推論学習機械学習
LeAct: 専門家の行動から推論を学習する
専門家システムの行動から、その背後にある思考の連鎖を潜在変数として復元し、自然言語の推論として学習する手法を提案。ゲームやロボティクスで直接模倣を上回る性能を達成した。
原題: LeAct: Learning to Reason from Expert Actions / Ziran Yang, Chengshuai Shi, Raj Ghugare 他
日本語で読む → - 論文強化学習AI
専門家行動事前強化学習
オンライン強化学習のサンプル効率を向上させるため、オフラインデータに依存せず、オンラインリプレイバッファから専門家ポリシー事前分布を生成するQ誘導CVAEを提案し、専門家行動ガイダンスとポリシー勾配補正を統合したアルゴリズムEBPを導入した。
原題: Expert Behavior Prior Reinforcement Learning / Gong Gao, Weidong Zhao, Xianhui Liu 他
日本語で読む → - 論文強化学習機械学習
階層的アクションチャンキングを用いたオフライン強化学習
オフライン目標条件付き強化学習において、高レベルの潜在プランニングと低レベルのアクションチャンキングを組み合わせたHiQCを提案し、長期的タスクでの価値推定誤差を低減して性能を向上させた。
原題: Offline RL with Hierarchical Action Chunking / Ahad Jawaid
日本語で読む → - 論文拡散ポリシー/推論高速化画像認識
拡散ポリシー推論を高速化する進化的キャッシュスケジュール
拡散ポリシーの推論コストを削減するため、進化的探索でキャッシュ更新スケジュールを最適化する訓練不要のフレームワークEVOを提案。冗長な計算をスキップしつつ性能を維持し、最大8.05倍の高速化を達成。
原題: Evolving Cache Schedules for Fast Diffusion Policy Inference / Siying Wang, Kangye Ji, Di Wang 他
日本語で読む → - 論文変形モデリング画像認識
ODeform: ニューラルODEによる連続4次元変形運動の学習
変形物体の連続的な動きをニューラル常微分方程式でモデル化し、離散時間ステップを不要にしつつ効率的に予測する手法を提案した。
原題: ODeform: Learning Continuous 4D Motion for Shape Deformation with Neural ODEs / Yordanka Velikova, Mahdi Saleh, Liming Kuang 他
日本語で読む → - 論文人物追跡ロボティクス
継続学習を用いたコンパニオンロボットのジンバル式人物追跡
モバイルロボットに搭載したジンバルカメラを能動制御し、人物を視野内に維持する追跡手法を提案。継続学習で外見変化に適応し、歩行から走行まで安定追跡を実現。
原題: Gimbal-Based Human Tracking for Companion Robots Using Continual Learning / Cong-Thanh Vu, Ching-Chieh Liu, Yen-Chen Liu
日本語で読む → - 論文マルチエージェント強化学習cs.MA
Dreamer-CPC: 世界モデルを用いたメッセージ学習による分散型マルチエージェント強化学習
分散型マルチエージェント強化学習において、世界モデルの潜在状態からメッセージを生成する手法を提案し、観測が欠落するタスクで既存手法を大きく上回る性能を達成した。
原題: Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning / Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi
日本語で読む → - 論文エージェント評価AI
DocOps: 複雑な文書操作における自律エージェントのための検証可能なベンチマーク
文書操作を階層的に分解した検証可能なベンチマークDocOpsを提案し、既存エージェントの限界と失敗モードを明らかにした。
原題: DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations / Jiazhen Jiang, Boxi Cao, Lingyong Yan 他
日本語で読む → - 論文3D占有予測画像認識
GaussianSeed: 高解像度3D占有予測のための階層的ガウスシーディング
高解像度の3D占有予測を効率的に行うため、粗密の階層構造を持つガウスプリミティブを用いたフレームワークを提案し、0.1m解像度でリアルタイム推論を実現した。
原題: GaussianSeed: Hierarchical Gaussian Seeding for High-Resolution 3D Occupancy Prediction / Xinzhuo Li, Xianghui Pan, Jiayuan Du 他
日本語で読む → - 論文異常検知制御
自動車アクティブセーフティ試験における移動ロボットの時系列異常検知:RNN-VAEによるアプローチ
自動車のアクティブセーフティ試験で使われる移動ロボットのハードウェア欠陥を、未ラベルデータを事前学習に活用したGRU-VAEベースの再構成型時系列異常検知モデルで検出する手法を提案。6種類の欠陥をF1スコア0.936で検出できることを実証した。
原題: Time-Series Anomaly Detection for Mobile Robots in Automotive Active Safety Testing using an RNN-VAE / Henrik Meyer, Karsten Raguse, Armando Walter Colombo 他
日本語で読む → - 論文継続学習/モデルベースRL機械学習
世界モデルは覚え、アクターは忘れる:継続的モデルベース強化学習のためのドリームリハーサル
DreamerV3系のモデルベース強化学習エージェントはタスク系列学習で破滅的忘却を起こすが、その原因が世界モデルではなくアクターの崩壊にあることを示し、世界モデルの生成する夢を自己模倣学習で利用する手法を提案した。
原題: The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL / Gurp Nijjer
日本語で読む → - 論文手術AI/視覚言語モデル画像認識
潜在アクション誘導による手術インタラクション認識のための視覚ファインチューニング
手術中の器具と組織の相互作用を認識するため、潜在アクションで誘導する視覚言語モデルのファインチューニング手法を提案。逆動力学モデルと前方世界モデルを用いてアクション関連領域の表現を強化し、パッチレベルの正則化で局所特徴の崩壊を防ぐ。
原題: LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition / Jiajun Cheng, Subarna Tripathi, Sainan Liu 他
日本語で読む → - 論文シミュレーションAI
サイバーフィジカルシステムにおけるシミュレーション証拠からの影響知識を洗練するための概念的枠組み
本論文は、サイバーフィジカルシステムのシミュレーション結果をより深く理解するために、「影響」という新しい概念を用いた概念的枠組みを提案し、モバイルロボットのケーススタディで実証している。
原題: A Conceptual Framework for Refining Influence Knowledge from Simulation Evidence in Cyber-Physical Systems / Barbara da Silva Oliveira, Julien Deantoni, Nicolas Ferry
日本語で読む → - 論文強化学習機械学習
能動的推論を凸マルコフ決定過程として捉える
能動的推論(AIF)の期待自由エネルギー最小化を、閉ループ制御ポリシーに対して凸マルコフ決定過程(MDP)として定式化し、鏡像降下アルゴリズムを導出した。
原題: Active Inference as a Convex Markov Decision Process / Nikola Milosevic, Nicolás Hinrichs, Nico Scherf
日本語で読む → - 論文サービスロボットロボティクス
介護施設向けサービスロボットのマルチモーダル言語モデル駆動による対話と伴走
介護施設のサービスロボットに、能動的な人物追従、LLMによる音声対話、VLMによる転倒検知を統合したシステムを提案し、実験でその有効性を示した。
原題: Multimodal-Language-Model-Driven Interaction and Companionship for Service Robots in Elderly-Care Facilities / Ching-Chieh Liu, Cong-Thanh Vu, Yen-Chen Liu
日本語で読む → - 論文VLAAI
Athena-Brain技術報告:汎用知能と身体化インタラクションのための効率的なロボット脳
8B規模のLLMをロボットのオンデバイス脳として開発し、多段階のポストトレーニングにより汎用知能と身体化インタラクション能力を両立させた。
原題: Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction / Jialian Li, Junhong Liu, Yuchen Cao 他
日本語で読む → - 論文VLAAI
言語的文脈が視覚言語モデルの視覚表現を再コード化する
視覚言語モデルにおいて、言語プロンプトが視覚表現を再コード化する仕組みを解明し、目標関連オブジェクトの参照表現と属性変調の因果的役割を実証した。
原題: Linguistic Context Recodes Visual Representations in Vision-Language Models / Brian Song, Michael A. Lepori, Ellie Pavlick
日本語で読む → - 論文ビジュアル合成/ベンチマーク画像認識
ExpertVerse: 知識集約型ビジュアル合成における専門家レベルの推論のための汎用ベンチマーク
本論文は、知識集約型の画像生成における推論能力を評価するベンチマークExpertVerseを構築し、推論トレース付き大規模データセットとRL微調整による推論エンジンKnowThinkerを提案した。
原題: ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis / Yuan Wang, Yongchao Du, Mengting Chen 他
日本語で読む → - 論文ソフトロボティクス/接触力学機械学習
粘弾性ヘルツ接触における時間分解接着力の深層学習による予測
粘弾性軟質接触の接着力の時間変化を、深層学習モデルを用いて高速に予測する手法を提案した。
原題: Deep learning-based prediction of time-resolved adhesive forces in viscoelastic Hertzian contacts / Ali Maghami, Merten Stender, Michele Ciavarella 他
日本語で読む → - 論文ワールドモデル画像認識
ABot-World-0: 単一デスクトップGPU上での無限インタラクティブワールドロールアウト
単一のデスクトップGPUでリアルタイムに長時間のインタラクティブなビデオ生成を実現するアクション条件付きワールドモデルを提案し、データ収集から推論最適化までを統合したシステムを構築した。
原題: ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU / Fan Jiang, Zhaoxu Sun, Mengchao Wang 他
日本語で読む → - 論文制御機械学習
目標非依存の偏微分方程式制御のための共同埋め込み予測制御
報酬や目標なしで学習した凍結済みの世界モデルをMPPIコントローラに再利用し、運動エネルギーなどの物理量を追跡することで偏微分方程式の制御を実現する手法を提案した。
原題: Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations / Jonathan Gallagher, Roberto Guglielmi
日本語で読む → - 論文LLM評価機械学習
HindsightBench:時間インデックス付きLLM意思決定タスクにおけるパラメトリック後知恵のブラックボックス行動監査プロトコル
LLMが過去の日付に紐づく意思決定タスクで、その後の出来事に関するパラメトリック知識を漏洩する現象を、プローブレベルのコストで監査するブラックボックスプロトコルを提案した。15モデルに適用し、日付トリガー反射がスケール現象ではなく訓練の新しさに依存することなどを明らかにした。
原題: HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks / Haozhe Jia
日本語で読む → - 論文世界モデル機械学習
多時間地平線の整合性を幾何学として捉える:潜在ダイナミクスが収縮するとき、しないとき
世界モデルにおける多ステップ潜在整合性の重みを変え、潜在空間の収縮性と予測誤差への影響を実験的に調べた論文。
原題: Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not / Kavya Bhand, Aadi Joshi
日本語で読む → - 論文医療応用画像認識
統合失調症の認知リハビリテーションのための対話型視覚言語プラットフォーム
統合失調症患者の認知リハビリテーション課題における動作の正しさを、カメラ映像と視覚言語モデルを用いて自動検証するフレームワークを提案した。
原題: An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia / Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi
日本語で読む → - 論文システム/展開最適化機械学習
FlashRT: エージェントを誘導してリアルタイムマルチモーダルアプリケーションを展開するエージェントハーネス
FlashRTは、コーディングエージェントを誘導して、開発者が書いた簡単な参照実装を最適化されたマルチGPU展開に変換するエージェントハーネスです。チェーン・オブ・プログラムという新しいパラダイムを用いて、中間表現の生成、検証、静的解析、そして測定ゲート付き最適化ループを通じて、レイテンシとスループットの目標を柔軟に調整します。
原題: FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications / Krish Agarwal, Zhuoming Chen, Yanyuan Qin 他
日本語で読む → - 論文エージェント型AIAI
重要システムのための信頼できるエージェント型AIの設計
自律的に行動するエージェント型AIを重要インフラに適用する際に必要な信頼性を、安全性や透明性などの5つの観点から整理し、各分野での課題と共通パターンをまとめたサーベイ論文。
原題: Engineering Trustworthy Agentic AI for Critical Systems / Omar Al-Refai, Ibrahim Shahbaz, Adam Ali Husseinat 他
日本語で読む →