論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/12 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文プライバシー保護画像認識
DiffUE: 拡散オートエンコーダによる非学習可能例の実用性と非学習性のトレードオフ向上
画像のピクセル空間ではなく意味空間にノイズを注入することで、視覚品質を保ちながら敵対的訓練などの再学習戦略に耐性を持つ非学習可能例を生成する手法を提案した。
原題: DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders / Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik 他
日本語で読む → - 論文3D生成cs.GR
LATO.2: 頂点とトポロジーフローによる分解型3Dメッシュ生成
メッシュ生成を頂点生成と接続生成に分解し、粗いボクセル構造を基盤にしたフローマッチングで高品質な3Dメッシュを生成する手法を提案。
原題: LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow / Hang Long, Tianhao Zhao, Junkai Lin 他
日本語で読む → - 論文世界モデル機械学習
潜在世界モデルにおける予測可能性の制御理論
潜在世界モデルの予測誤差と制御性能の関係を理論的に分析し、データ平均誤差では制御性能を保証できないことを示し、計画コストの乖離に基づく新たな目的関数を提案した。
原題: A Control Theory of Predictability in Latent World Models / Hanzhe You, Yonggang Zhang, Maohao Ran 他
日本語で読む → - 論文世界モデル機械学習
潜在世界モデルにおける適応的計算:深さが役立つとき、害になるとき、無関係なとき
世界モデルのロールアウトで、各ステップの計算量を変える適応的計算が有効かどうかを、浅い出口と深いフル深度の誤差比を用いて9つのタスクで検証。深さが役立つ場合、害になる場合、無関係な場合の3つの領域を発見し、害になる現象は訓練方法に起因することを示した。
原題: Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter / Achyuthan Sivasankar
日本語で読む → - 論文sim2realAI
シミュレーションから実世界へのギャップを測る:AIoTシステムにおける強化学習のための低コスト実世界ベンチマークプラットフォームの設計
強化学習のシミュレーションから実世界への転移性能を評価するため、市販部品で400ドル未満の実世界AIoTベンチマークプラットフォームを構築し、シミュレーション訓練エージェントが実世界で性能劣化することを示した。
原題: Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems / Rongping Zhou, Omid Tavallaie, Shuaijun Chen 他
日本語で読む → - 論文システム/分散推論cs.DC
ステートフルな世界、ステートレスな弾力性:対話型ワールドモデルのための厳密状態サービス
対話型ワールドモデルの実行状態(巨大なアテンションキャッシュ)を、ビット単位で同一のまま別GPUへ高速移行する手法WorldMoveを提案し、18.8msでの移行と48回全ての移行がビット同一であることを実証した。
原題: Stateful Worlds, Stateless Elasticity: Exact-State Serving for Interactive World Models / Jin Li, Jiawei Chen
日本語で読む → - 論文プライバシー保護/敵対的例画像認識
視覚言語モデルに対する知覚不能かつ可逆な敵対的例によるプライバシー保護
視覚言語モデルへのテキストベースのプライバシー攻撃から画像を守るため、拡散モデルと可逆ネットワークを組み合わせた高画質で可逆な敵対的例生成フレームワークCloakDiffを提案した。
原題: Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection / Qi Lu, Ziqi Zhou, Yufei Song 他
日本語で読む → - 論文量子計算/超次元計算機械学習
対数符号化による超次元分解のための量子ビット効率的量子探索
超次元計算の分解問題を量子探索で解く際、従来のO(D)量子ビット表現をO(log D)に削減する量子フレームワークを提案し、最大2000倍の量子ビット削減を実現した。
原題: Qubit-Efficient Quantum Search for Hyperdimensional Decomposition via Logarithmic Encoding / Sanggeon Yun, Hyunwoo Oh, Ryozo Masukawa 他
日本語で読む → - 論文イベントカメラ/画像追跡画像認識
イベントカメラを用いた高性能画像追跡のための等変フィルタ
イベントカメラの出力から特徴位置を抽出し、等変フィルタを用いてアフィン変換(並進と回転)を高精度に推定する画像追跡手法を提案した。
原題: Equivariant Filter for High Performance Image Tracking using an Event Camera / Angus Apps, Yixiao Ge, Timothy L. Molloy 他
日本語で読む → - 論文エッジ推論画像認識
見るのは無料、話すのは有料:エッジVLM推論における真のエネルギーボトルネックの解明
エッジデバイスでのVLM推論のエネルギー消費を初めて体系的にプロファイリングし、出力トークン数がレイテンシとエネルギーの主要因であることを明らかにした。
原題: Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference / Junfei Zhan, Haoxun Shen, Mingang Guo 他
日本語で読む → - 論文VLA画像認識
ビデオ生成モデルは汎用視覚学習器である
大規模テキストからビデオへの生成を視覚の事前学習パラダイムとして用い、テキスト指示で様々な視覚タスクを実行できる汎用モデルGenCeptionを提案した。
原題: Video Generation Models are General-Purpose Vision Learners / Letian Wang, Chuhan Zhang, Rishabh Kabra 他
日本語で読む → - 論文CT再構成eess.IV
挑戦的な撮影条件下でのコーンビームCTにおける微分可能なシフト変分FBPのロバスト性と安定性解析
微分可能なシフト変分フィルタ補正逆投影法のロバスト性を、不規則な軌道やスパースビューなどの困難な条件下で系統的に評価し、その安定性と限界を明らかにした。
原題: Robustness and Stability Analysis of Differentiable Shift-Variant FBP for Cone-Beam CT under Challenging Acquisition Settings / Chengze Ye, Linda-Sophie Schneider, Yipeng Sun 他
日本語で読む → - 論文VLA/強化学習機械学習
少ないデータから多くを学ぶ:後知恵からの強化学習
VLAモデルの強化学習後訓練において、失敗したロールアウトを実際に達成したタスクに再ラベル付けする「後知恵からの学習」を提案し、サンプル効率を5倍向上させた。
原題: Learning More from Less: Reinforcement Learning from Hindsight / Iris Xu, Sunshine Jiang, John Marangola 他
日本語で読む → - 論文音声解析/ヘルスケア自然言語
音から症状へ:会話型ヘルスケアエージェントのためのリアルタイム呼吸信号理解
会話中の咳などの呼吸音をリアルタイムで検出・分類し、会話の流れを妨げずに臨床的に有用な情報を提供するパイプラインを提案した。
原題: From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents / Tanmay Laud, Herprit Mahal, Subhabrata Mukherjee
日本語で読む → - 論文音声認識/テスト生成cs.CR
自動音声認識システムの生成的テスト手法
音声認識システムの脆弱性を検出するため、テキスト読み上げモデルの音素潜在空間で補間を行い、自然な音声を保ちつつ誤認識を誘発する入力を生成するブラックボックス攻撃手法を提案した。
原題: Generative Testing of Automated Speech Recognition Systems / Yanis Xabier Wilbrand Peña, Oliver Weißl, Andrea Stocco
日本語で読む → - 論文群制御AI
通信効率を重視した異種LLM具現化エージェント群のデジタルツイン協調制御
異なる大規模言語モデルを搭載したエージェント群の協調を、軽量デジタルツインとルールベースのオーケストレータで実現し、通信コストと遅延を削減する枠組みを提案した。
原題: Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks / Nuocheng Yang, Sihua Wang, Zihan Chen 他
日本語で読む → - 論文物体追跡/再識別画像認識
REMIND: 屋内ナビゲーションのためのメモリを用いた再識別
屋内ロボットが長期間・視点変化・照明変化を経た物体を再識別するためのオンライントラッカーREMINDを提案。DINOv3特徴とメモリ機構を組み合わせ、カメラ位置や深度を必要とせずに高い再識別精度を達成した。
原題: REMIND: RE-Identification with Memory for INDoor Navigation / Pablo Diaz-Pereda, Alejandro Rodriguez-Ramos, David Perez-Saura 他
日本語で読む → - 論文回帰/ニューラルネットワーク画像認識
オイラー角回帰の再考:コルモゴロフ-アーノルドネットワークによるアプローチ
オイラー角の回帰問題を再考し、範囲を考慮したオイラー角モデリングとKANを組み合わせた新しいフレームワークを提案。理論的解析と実験により、KANの加法構造がオイラー角回帰に有効であることを示した。
原題: Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks / Yangting Sun, Zijun Cui, Yufei Zhang
日本語で読む → - 論文3D再構成画像認識
VGGTが知る重なり: 幾何基盤モデルにおける共可視性の探査
VGGTの内部表現が共可視性を暗黙に符号化していることを発見し、軽量なMixture-of-Expertsヘッドを追加してRGB画像のみから共可視性を高精度に分類する手法を提案した。
原題: What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility / Filippo Ziliotto, Luciano Serafini, Lamberto Ballan 他
日本語で読む → - 論文画像検出画像認識
変換は真実を明らかにするか?生成的残差学習による汎用AI生成画像検出
生成AIによる画像検出の汎化性能を高めるため、ニューラルテンソルネットワークを用いた生成的残差学習フレームワークGenResと、複数変換を扱うGenRes++を提案した。
原題: Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection / Kutub Uddin, Nusrat Tasnim, Awais Khan 他
日本語で読む → - 論文ワールドモデル機械学習
言語接地ワールドモデルのための書き込み保護離散ボトルネック:構造的限界と十分な修正
言語特徴をロボットのワールドモデルに注入する既存手法が、Gumbel-softmax離散ボトルネックで構造的失敗を起こすことを示し、勾配遮断・非パラメトリック記憶表・DP-Meansクラスタリングの3層修正で接地精度を大幅改善した。
原題: Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix / Jiayi Fang
日本語で読む → - 論文エージェント計画AI
GATS: 階層的世界モデルを用いたグラフ拡張木探索による効率的なエージェント計画
LLMエージェントの計画時に推論コストを削減するため、UCB1ベースの木探索と3層の世界モデルを組み合わせたGATSを提案し、LLM呼び出しなしで高い成功率を達成した。
原題: GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning / Maureese Williams, Dymitr Nowicki
日本語で読む → - 論文再照明画像認識
空間制御可能な多視点屋内シーン再照明のための分離照明事前分布
屋内シーンの再照明を、事前学習済み拡散モデルから照明パレットを抽出する段階と、粗い3D形状から目標照明条件を明示的にマッピングする段階に分離し、空間制御と多視点一貫性を両立するフレームワークを提案した。
原題: Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting / Chenjian Gao, Linning Xu, Tianfan Xue
日本語で読む → - 論文群制御cs.IT
6G閉ループ制御のための深層強化学習を用いたワイヤレスセンサネットワーク
遠隔地や危険な環境で動作するロボットの制御性能を最適化するため、センサからエッジ情報ハブへの帯域割り当てを深層強化学習(PPO)で学習する手法を提案した。
原題: Deep Reinforcement Learning-Empowered Wireless Sensor Networking for 6G Closed-Loop Controls / Chengleyang Lei, Wei Feng, Yunfei Chen 他
日本語で読む → - 論文SLAM画像認識
Track2Map: ロボット手術における動作認識ポーズ最適化を用いたオンライン変形SLAM
手術映像からカメラ軌跡と変形する3Dシーンを同時に最適化するオンライン3DガウススプラッティングSLAM手法を提案し、カメラ軌跡の事前情報がない場合でも高品質な再構成を実現した。
原題: Track2Map: Online Deformable SLAM with Motion-Aware Pose Optimization in Robotic Surgery / Tianyi Song, Sierra Bonilla, Xinwei Ju 他
日本語で読む → - 論文強化学習/探索機械学習
プロンプト駆動探索
ロボット操作や推論タスクにおいて、報酬が得られない初期状態からでも、視覚言語モデルがロールアウト動画を分析してプロンプトを書き換えることで探索を促進し、強化学習の成功を可能にする手法を提案した。
原題: Prompt-Driven Exploration / Sunshine Jiang, John Marangola, David Zhang 他
日本語で読む → - 論文プライバシー防御画像認識
3D FaceShell: 3D顔アバターにおける属性転送を利用したVLM防御メカニズム
3D顔アバターのレンダリング画像からVLMが機密属性を推論するのを防ぐため、学習可能なガウスシェルで視覚的に目立たない摂動を加え、VLMの解釈を操作するフレームワークを提案した。
原題: 3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism / Weston Bondurant, Srijan Das, Hieu Le 他
日本語で読む → - 論文VLA画像認識
自己中心視点のビデオ言語モデルは手と物体の両方の手がかりを捉えているか?
手と物体の相互作用認識において、既存のビデオ言語モデルが手や物体の見た目や動きではなく環境の相関に頼る問題を指摘し、手と物体のマスク学習と動的デコーダを導入して両方の手がかりを活用する手法を提案した。
原題: Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues? / Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda 他
日本語で読む → - 論文モビリティ管理cs.IT
大規模マルチモーダルモデルに基づく環境認識型モビリティ管理
大規模マルチモーダルモデルを用いてRGB-D画像から環境情報を抽出し、ユーザー端末の移動パターンやチャネル容量を予測して、ハンドオーバー決定を最適化する方式を提案した。
原題: Large Multimodal Model-Based Environment-Aware Mobility Management / Seokhyun Jeong, Sangmok Shin, Seungnyun Kim 他
日本語で読む → - 論文VLA画像認識
LEEVLA: 潜在環境進化における重要情報の認識による視覚言語行動モデル
視覚言語行動モデルが動的環境でタスクに重要な視覚情報を強調し、潜在世界表現の構造的進化を保つための新しいアーキテクチャを提案。ドリフト誘導型動的優先化と構造的特徴フロー生成により、タスク認識の「どこで・どのように」学習を実現し、ベンチマークで優れた性能を示した。
原題: LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action / Qi Lyu, Baicheng Liu, Xudong Wang 他
日本語で読む →