論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/23 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3Dシーン理解画像認識
物理世界モデリングによる統合3Dシーン理解
3Dシーン理解の多様なタスク(深度推定、新規ビュー合成、物体操作)を、確率的グラフィカルモデルとして統一し、タスク固有の学習なしでゼロショット実行できる物理世界モデル3WMを提案した。
原題: Unified 3D Scene Understanding Through Physical World Modeling / Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh 他
日本語で読む → - 論文セグメンテーション画像認識
画像条件付きインスタンスプロンプトネットワークによる参照リモートセンシング画像セグメンテーション
リモートセンシング画像の参照セグメンテーションにおいて、画像条件付きインスタンスプロンプトと双方向情報融合を導入し、クロスモーダル特徴融合のボトルネックを解消する新しいネットワークを提案した。
原題: Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation / Biaoyu Ren, Qingsheng Wang, Cun Xu 他
日本語で読む → - 論文生理信号/認知状態推定機械学習
Synheart Capacity:ウェアラブル信号からの認知容量ダイナミクスの理論駆動型生理学的表現
心臓と皮膚電気活動の信号から、努力とストレスの2次元状態として認知容量を推定する理論駆動のマルチモーダル学習フレームワークを提案し、SWELL-KWデータセットで個人間一般化を実証した。
原題: Synheart Capacity: A Theory-Driven Physiological Representation of Cognitive Capacity Dynamics from Wearable Signals / Yisak Debele, Henok Ademtew, Israel Goytom
日本語で読む → - 論文生成モデル機械学習
生成事前分布を超えて:JEPAガイド拡散によるマイノリティサンプリング
実世界の意味的希少性に基づくマイノリティサンプリングを実現するため、JEPA(世界モデル)のガイダンスを拡散モデルに組み込む手法を提案。近似戦略と理論的誤差限界により計算コストを削減し、様々な生成タスクで有効性を実証した。
原題: Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion / Sol Park, Soobin Um
日本語で読む → - 論文世界モデル機械学習
言語的監督なしの物理的相互作用による世界モデルにおける創発的意味表現
言語を使わずに身体的な探索だけで学習した世界モデルの潜在空間が、物理世界の幾何学的構造を反映した意味的構造を自発的に獲得することを示した論文。
原題: Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision / Jiayi Fang
日本語で読む → - 論文視覚推論画像認識
VisAnalog: 自然画像における視覚概念転移の診断スイート
自然画像上で視覚概念の転移能力を評価するベンチマークVisAnalogを提案し、強力なVLMでも人間より精度が低く、変換ステップが増えると性能が急落することを示した。
原題: VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images / Zhaonan Li, Kyle R. Chickering, Bangzheng Li 他
日本語で読む → - 論文データベースと深層学習の統合cs.DB
データベースクエリへの深層学習設計の統合
リレーショナルデータに対する深層学習を、データベースクエリの自然な拡張として統合する手法を提案し、各タプルに学習可能なベクトル埋め込みを関連付けてクエリを拡張する。
原題: Incorporating Deep Learning Design in Database Queries / Yuval Lev Lubarsky, Dean Light, Boaz Berger 他
日本語で読む → - 論文物体姿勢追跡画像認識
ComPose: 物体姿勢追跡における手の信頼タイミングの決定
RGB動画から手の動きを補助情報として活用し、重度の手による遮蔽下でも頑健に物体の6DoF姿勢追跡を行うフレームワークを提案した。
原題: ComPose: When to Trust Hands for Object Pose Tracking / Jisu Shin, Junoh Lee, JunGyu Lee 他
日本語で読む → - 論文敵対的攻撃機械学習
テスト時適応に対するサンプル単位の標的型敵対的攻撃
テスト時適応(TTA)の脆弱性を突く、特定のトリガーを持つサンプルのみを誤分類させるサンプル単位の標的型攻撃を提案し、メタ学習と勾配整列戦略により攻撃成功率と分布ステルス性を両立させた。
原題: Sample-wise Targeted Adversarial Attacks on Test-time Adaptation / Phuc Duc Nguyen, Quang Duc Nguyen
日本語で読む → - 論文動画編集画像認識
オクルージョンを考慮した物理・意味的キーフレーム選択によるロバストな動画編集
動画編集において、オクルージョンや視点変化に強い編集を実現するため、物理的・意味的に信頼できるキーフレームを自動選択し、それを基に編集を行うフレームワークを提案した。
原題: Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing / Lin Liu, Zhihan Xiao, Haohang Xu 他
日本語で読む → - 論文強化学習機械学習
スコアベース一段階MeanFlow方策最適化
強化学習における拡散・フローマッチング方策の多段階推論コストを削減するため、Q関数からスコア推定と確率フローODEで目標速度場を構築し、一段階生成で高価値モードに集中させる新しいアクタークリティック法SOMを提案した。
原題: Score-Based One-step MeanFlow Policy Optimization / Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn 他
日本語で読む → - 論文因果推論機械学習
基盤モデルを活用した因果生成モデリング
事前学習済み基盤モデルを用いて、因果推論と画像生成を組み合わせたゼロショットの因果発見・介入・反事実生成を実現するフレームワークを提案した。
原題: Leveraging Foundation Models for Causal Generative Modeling / Aneesh Komanduri, Xintao Wu
日本語で読む → - 論文ロバスト性評価機械学習
WMAttack: ワールドモデルエージェントの敵対的評価のための自動攻撃探索
ワールドモデルエージェントの敵対的ロバスト性を評価する自動攻撃探索フレームワークWMAttackを提案し、自己修正攻撃探索と表現誘導攻撃検索により、既存手法より強い攻撃を発見する。
原題: WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents / Zhixiang Guo, Siyuan Liang, Shi Fu 他
日本語で読む → - 論文医療時系列予測機械学習
ChronoMedicalWorld:縦断的ケアデータから患者軌跡を学習する医療ワールドモデル
長期的な臨床シミュレーションのための行動条件付き潜在ワールドモデルを提案し、慢性腎臓病のeGFR軌跡予測で既存モデルより高い精度を達成した。
原題: ChronoMedicalWorld: A Medical World Model for Learning Patient Trajectories from Longitudinal Care Data / Jiangyuan Wang, Xuyong Chen, Junwei He 他
日本語で読む → - 論文制御制御
一輪車エージェントのためのベアリングのみを用いたフェルマー・ウェーバー位置問題の解法
非ホロノミック制約を持つ一輪車ロボットに対して、ベアリング(方位)情報のみを用いてフェルマー・ウェーバー点へ到達・追従する制御則を提案した論文。静止・移動ビーコン、飽和入力の場合を扱い、シミュレーションと実験で有効性を示した。
原題: Bearing-Only Solution to the Fermat-Weber Location Problem for Unicycle Agent / Hong Liang Cheah, Mohammad Deghat, Jose Guivant
日本語で読む → - 論文時系列モデリング機械学習
ワールドマシン:時系列のための生成的ワールドモデリングに向けて
時系列データのための生成的ワールドモデルを提案し、潜在状態を持つトランスフォーマーアーキテクチャにより、観測データ量や文脈に適応できることを示した。
原題: World Machine: Towards Generative World Modeling for Time-Series / Elton Cardoso do Nascimento, Alexandre da Silva Simões, Esther Luna Colombini 他
日本語で読む → - 論文VLA画像認識
抽象から具体へ:視覚言語行動モデルのための行動表現学習
VLAモデルの分布シフト下での性能低下に対し、長期的な行動表現を学習するBehaviorVLAを提案。因果Mambaベースのエンコーダと位相条件付きデコーダで、シミュレーションと実世界で高い成功率とデータ効率を達成。
原題: From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model / Bing Hu, Zaijing Li, Rui Shao 他
日本語で読む → - 論文モデルベース強化学習機械学習
勾配ペナルティ付き潜在ダイナミクスによる滑らかでサンプル効率的な夢の学習
モデルベース強化学習のDreamerV3に、潜在遷移ダイナミクスの局所的な滑らかさを促す勾配ペナルティ正則化を追加し、サンプル効率を向上させた。
原題: Dreaming Smoothly and Sample Efficiently with Gradient Penalized Latent Dynamics / Romil V. Sonigra, P. R. Kumar
日本語で読む → - 論文画像分類画像認識
偽画像検出のための深層学習モデルの比較評価
GANによる偽画像検出のために、4つの事前学習CNNモデル(VGG16、ResNet50、EfficientNetB0、XceptionNet)を統一パイプラインで比較し、VGG16が最高精度91%を達成した。
原題: Comparative Evaluation of Deep Learning Models for Fake Image Detection / Akhitha Pakala, Mohammed Mahir Rahman, Shahzad Memon 他
日本語で読む → - 論文空間知能評価画像認識
ArchSIBench: 視覚言語モデルの建築空間知能のベンチマーク評価
建築空間の知能を評価する新しいベンチマークを提案し、視覚言語モデルの空間認知能力を人間と比較して分析した。
原題: ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models / Qirui Shen, Wenda Wang, Jiachen Lu 他
日本語で読む → - 論文VLA画像認識
視覚と言語を理解し、人間や環境と対話する機械知能
画像キャプション、視覚対話、対話型指示追従の3つのタスクに対して、新しいアーキテクチャを提案し、性能と効率を向上させた博士論文。
原題: Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments / Van Quang Nguyen
日本語で読む → - 論文自動運転画像認識
思考の蒸留と行動の予見:自動運転のための認知物理強化学習
自動運転のための認知物理強化学習フレームワークCoPhyを提案。VLM知識を蒸留して認知能力を保持しつつ、BEV世界モデルで将来予測を行い、安全と意図適合の二重報酬でポリシーを最適化する。
原題: Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving / Yang Wu, Qiang Meng, Zhaojiang Liu 他
日本語で読む → - 論文画像編集/透かし画像認識
透かし入り画像は編集可能か?透かしを保持するテキスト誘導画像編集のためのSafeMark
テキスト誘導画像編集において、意味的に妥当な編集を行いながら埋め込まれた透かしを保持するフレームワークSafeMarkを提案した。
原題: Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing / Xiaodong Wu, Qi Li, Xiangman Li 他
日本語で読む → - 論文ナビゲーション画像認識
P2DNav: パノラマから俯瞰への推論によるゼロショット視覚言語ナビゲーション
ゼロショットの視覚言語ナビゲーションにおいて、パノラマ方向選択と俯瞰ローカル接地を分離した階層的フレームワークを提案し、性能を向上させた。
原題: P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation / Kai Sheng, Liuyi Wang, Haojie Dai 他
日本語で読む → - 論文医用画像処理/レンダリングcs.GR
分散型ダイレクトボリュームレンダリング:リソース制約環境におけるMRIデジタルツインのためのブラウザネイティブGPUアーキテクチャ
サーバーサイドレンダリングや高価なワークステーションに依存せず、ブラウザ上のWebGPUを用いて低コストGPU上でMRIデータの高精細なデジタルツインを直接レンダリングする分散型アーキテクチャを提案した論文。
原題: Decentralized Direct Volume Rendering: A Browser-Native GPU Architecture for MRI Digital Twins in Resource-Constrained Settings / Oserebameh Augustine Beckley
日本語で読む → - 論文ビジョンモデル評価画像認識
MAPS: 制御された3Dシーン空間で視覚モデルを探るための合成データセット
視覚モデルの予測を駆動するシーン特性を調べるため、2,618個の写実的な3Dメッシュと9つの独立したシーン因子を連続的に変化させられるレンダリングパイプラインを備えた合成データセットMAPSを導入し、20種類のモデルの感度分析を行った。
原題: MAPS: A Synthetic Dataset for Probing Vision Models in a Controlled 3D Scene Space / Santiago Galella, Pamela Osuna-Vargas, Maren Wehrheim 他
日本語で読む → - 論文群制御cs.MA
動的環境強制下での帆走群れのための速度重み付きフロッキング
風速に依存する操縦性の制約を持つ帆走ロボット群れの協調問題を扱い、速度重み付き相互作用則を提案して群れの分極と凝集性を改善した。
原題: Speed-Weighted Flocking for Sailing Swarms under Dynamic Environmental Forcing / Pranav Kedia, Aaron Gan, Hannah J. Williams 他
日本語で読む → - 論文映像生成画像認識
Aero-World: 慣性制御に基づく行動条件付き空中映像生成
事前学習済みの画像から映像への拡散モデルを、加速度や角速度などの慣性制御信号に従う空中映像生成器へ変換する手法を提案。実映像とIMUデータで訓練した物理プローブにより、映像の慣性整合性を監視しつつLoRAで微調整する。
原題: Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls / Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang 他
日本語で読む → - 論文操作/軌道予測画像認識
空間プロンプトを用いたエゴセントリック操作の視覚軌道予測
ロボット操作のタスク指示を空間的なプロンプト(バウンディングボックスや点)で行う新しい設定を提案し、エゴセントリック映像から将来のエンドエフェクタ軌道を予測する手法を開発した。
原題: Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation / Yifan Li, Xinyu Zhou, Yunhao Ge 他
日本語で読む → - 論文最適化機械学習
事前学習を超えたMuonの再考:VLAとRLVRにおけるスペクトル障害とハイパス対策
Muonオプティマイザの一様なスペクトル白色化が、VLAやRLVRで問題を引き起こすことを示し、高域通過型のNS反復を用いたPionを提案して性能を改善した。
原題: Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR / Chongyu Fan, Gaowen Liu, Mingyi Hong 他
日本語で読む →