論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/26 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文生成モデル/アライメント機械学習
サンプルベース変分推論の償却による少数ステップ生成モデルのアライメント
生成器と参照分布へのサンプルアクセスのみで少数ステップ生成モデルを整列させる一般的な枠組みFAVを提案し、ロボット操作のポリシー整列と画像生成器の整列で有効性を示した。
原題: Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference / Jaewoo Lee, Hyeongyu Kang, Dohyun Kim 他
日本語で読む → - 論文世界モデルstat.ML
LeJEPAはいつ世界モデルを学習するのか?
LeJEPAが非線形観測から世界の潜在変数を線形に復元できる条件を理論的に証明し、ガウス分布が唯一の保証を持つことを示した論文。
原題: When Does LeJEPA Learn a World Model? / David Klindt, Yann LeCun, Randall Balestriero
日本語で読む → - 論文3Dシーン理解画像認識
知覚してから計画する:単眼3Dシーン配置推定のためのレイアウト・アズ・ポリシー
単眼画像から3Dシーン配置を推定する際に、視覚言語モデルを用いて物体を認識し、物理的整合性を保つように配置を反復改善する手法を提案した。
原題: Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation / Junwei Zhou, Yu-Wing Tai
日本語で読む → - 論文VLA画像認識
LLaVA-OneVision-2:次世代知覚知能に向けて
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
原題: LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence / Xiang An, Yin Xie, Feilong Tang 他
日本語で読む → - 論文制御制御
不確かなDubinsシステムにおける曲率制約経路のロバスト追従
モデル不確かさを持つDubins車両に対して、横座標系でスライディングモード制御を用いたロバストな経路追従コントローラを提案し、外乱下でも横方向誤差と方位誤差をゼロに収束させることを示した。
原題: Robust Tracking of Curvature-Constrained Paths for Uncertain Dubins Systems / Xingjian Xue, Sze Zheng Yong
日本語で読む → - 論文自動運転シミュレーション画像認識
運転シーン生成のための物理認識3Dガウシアン編集
道路形状の編集と車両ダイナミクスを統合し、物理的に整合性のある運転シーン生成を実現するシステムを提案。
原題: Physics-Aware 3D Gaussian Editing for Driving Scene Generation / Feng Zhou, Jian Zhang, Yuhang Sun 他
日本語で読む → - 論文ディープフェイク検出画像認識
セグメンテーション誘導型空間インデキシングによる汎用的かつ説明可能なディープフェイク検出
顔のパッチトークンを意味ラベルで選別してから分類する空間インデキシング手法を導入し、口領域のみを用いた線形プローブでディープフェイクを高精度に検出する。
原題: Segmentation-Guided Spatial Indexing for Generalizable and Explainable Deepfake Detection / Izaldein Al-Zyoud, Abdulmotaleb El Saddik
日本語で読む → - 論文敵対的攻撃機械学習
解釈可能性が脆弱性になるとき:CBM概念層に対する敵対的攻撃
概念ボトルネックモデル(CBM)の概念層が敵対的攻撃の新たな攻撃面となることを示し、その脆弱性を定量化する枠組みと防御手法SPECTRAを提案した論文。
原題: When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers / Aditya Sridhar
日本語で読む → - 論文異常検出画像認識
能動的実物-デジタルツイン検査に向けて: ゼロショット異常検出の新パラダイム
固定視点の2D画像に依存する従来のゼロショット異常検出の限界を打破するため、実物の観測をCADデジタルツインと直接照合する新しいタスクを提案し、欠陥のないペアのみで学習するフレームワークAVATARを開発した。
原題: Towards Active Real-to-Twin Inspection: A New Paradigm for Zero-Shot Anomaly Detection / Jiaxuan Liu, Yunkang Cao, Yufeng Chen 他
日本語で読む → - 論文群制御画像認識
センチネル:具現化された協調的空間推論と計画
都市規模の屋外環境で複数の分散エージェントが自然言語で通信し、安全な待ち合わせ場所を協調して決定し、動的な哨戒を避けながら移動するためのフレームワークを提案した。
原題: Sentinel: Embodied Cooperative Spatial Reasoning and Planning / Xiangye Lin, Hongxin Zhang, Ruxi Deng 他
日本語で読む → - 論文ビデオ生成画像認識
E^3C: 3D環境メモリと自己・他者視点の人体ポーズ制御によるビデオ生成
エージェントの自己中心視点ビデオ生成のための拡散フレームワークで、点群ベースの3Dメモリと自己・他者視点の人体ポーズ制御を組み合わせ、シーン構造と人間の動きを分離して高品質な生成を実現した。
原題: E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control / Qiao Gu, Lingni Ma, Adam W Harley 他
日本語で読む → - 論文強化学習機械学習
拡散ポリシー最適化による世界モデル強化学習のスケーリング
世界モデルを用いた強化学習において、探索と価値学習の構造的不整合がスケーリングのボトルネックであることを特定し、拡散ポリシー表現で統一するMBDPOを提案した。
原題: Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization / Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu 他
日本語で読む → - 論文3D幾何推定画像認識
動的特徴正規化によるストリーミング映像の3D幾何安定化
ストリーミングRGB入力から一貫した3D幾何を推定する際の時間的不安定性を、特徴統計量の変動が原因と特定し、軽量な再帰モジュールDyFNを導入して安定化する手法を提案した。
原題: Stabilizing Streaming Video Geometry via Dynamic Feature Normalization / Xiaoyang Lyu, Muxin Liu, Xiaoshan Wu 他
日本語で読む → - 論文VLA画像認識
VLA初期化のためのVLM表現の再考
VLAモデルの初期化に使う事前学習済みVLM表現の設計を、能力別のVQA教師信号・パラメータ更新戦略・ロボットデータ事前学習の3軸で分析し、元のVLM表現の保持が重要で、LoRAベースの段階的学習が最良であることを示した。
原題: Rethinking VLM Representation for VLA Initialization / Weifeng Lin, Siyuan Huang, Hao Li 他
日本語で読む → - 論文離散事象システム/監督制御/サイバー攻撃制御
サイバー攻撃下における離散事象システムの決定的かつ非ブロッキングな監督制御
サイバー攻撃を受ける離散事象システムに対し、決定的かつ非ブロッキングな監督制御を実現するための必要十分条件を新たに提案し、検証手法も示した。
原題: Deterministic and Nonblocking Supervisory Control of Discrete Event Systems under Cyber Attacks / Feng Lin, Caisheng Wang, Jun Chen 他
日本語で読む → - 論文3D再構築画像認識
TriSplat: シミュレーション対応のフィードフォワード3Dシーン再構築
スパース視点からの3D再構築を、三角形プリミティブを用いてフィードフォワードで行い、シミュレーションに使えるメッシュを直接出力する手法を提案した。
原題: TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction / Weijie Wang, Zimu Li, Jinchuan Shi 他
日本語で読む → - 論文VLA/ロバスト性cs.CR
能力とロバスト性は両立できない:視覚言語行動モデルに対する情報理論的限界
視覚言語行動モデル(VLA)は、わずかな敵対的摂動で成功率が劇的に低下することを示し、その能力とロバスト性のトレードオフに理論的下限が存在することを情報理論的に証明した。
原題: Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models / Jianwei Tai
日本語で読む → - 論文LLMセキュリティcs.CR
大規模言語モデルのファインチューニングライフサイクルにおけるセキュリティ:脅威、防御、評価、そして将来の方向性
大規模言語モデルのファインチューニングにおけるセキュリティ脅威と防御策を、ライフサイクル(事前・中・後)に基づく統一フレームワークで体系的に調査し、統一環境での実験評価を行った論文。
原題: Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions / Wenjuan Li, Yitao Liu, Runze Chen 他
日本語で読む → - 論文ディープフェイク検出画像認識
顔ディープフェイク検出における視覚基盤モデルのクロスドメイン汎化限界
生成モデルの進化により超現実的な顔ディープフェイクが作られる中、未見の操作技術に対する検出器の汎化能力の限界を、視覚基盤モデルを特徴抽出器として用いて体系的に評価した論文。
原題: Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection / Ibrahim Delibasoglu
日本語で読む → - 論文ビデオワールドモデル画像認識
WorldCraft: カメラナビゲーションからオブジェクト操作へ - インタラクティブビデオワールドモデルにおける
ビデオベースのワールドモデルをカメラ操作からオブジェクトレベルの軌跡操作へ拡張するフレームワークを提案。ユーザーのクリックと描画パスに基づき、選択オブジェクトが軌跡に沿って動く未来フレームを生成する。
原題: WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models / Bohai Gu, Taiyi Wu, Yueyang Yuan 他
日本語で読む → - 論文制御/ロボティクス機械学習
リー群埋め込みによるニューラルダイナミクスの計画:教師付き射影多様体学習を通じて
リー群を多様体の対称性の内在表現として用い、勾配降下と計量射影に基づく学習アルゴリズムを開発し、一般のリー群上で学習可能かつ安定なダイナミクスを実現する。
原題: Planning Neural Dynamics with Lie Group Embedding through Supervised Projective Manifold Learning / Tianwei Wang, Bryan Chen, Qian Zuo 他
日本語で読む → - 論文3D占有予測画像認識
VEOcc: 身体化シーン理解のためのボクセル中心オンライン意味占有予測
オンライン3D占有予測とマッピングのためのボクセル中心フレームワークを提案し、初期スケール推定を不要にすることで効率的な地図拡張を実現し、時間的・空間的にロバストな更新戦略を導入した。
原題: VEOcc: Voxel-Centric Online Semantic Occupancy Prediction For Embodied Scene Understanding / Ruoyu Wang, Yong Liu, Sheng Tao 他
日本語で読む → - 論文ドメイン汎化機械学習
アブダクションとデダクションの絡み合い:表現移植によるドメイン汎化
ソース分布で訓練したモデルがターゲット分布でうまく機能しない問題に対し、因果的仮定の下で最適予測が部分的に識別可能であることを示し、表現空間での線形変換(表現移植)を用いてドメイン汎化を実現する手法を提案した。
原題: Abduction-Deduction Entanglement: Domain Generalization via Representation Transplants / Kasra Jalaldoust, Elias Bareinboum
日本語で読む → - 論文3Dアセット生成画像認識
Fishbone: 1つの3Dアセットから100万通りの制御可能な編集へ
3Dメッシュの形状変形を制御するための統一的なリブ・スパイン表現を提案し、リアルタイムで予測可能な変形やアニメーションを可能にする。
原題: Fishbone: From One 3D Asset to a Million Controllable Edits / Yumeng He, Xiaoying Wang, Peihao Li 他
日本語で読む → - 論文セグメンテーション画像認識
画像条件付きインスタンスプロンプトネットワークによる参照リモートセンシング画像セグメンテーション
リモートセンシング画像の参照セグメンテーションにおいて、画像条件付きインスタンスプロンプトと双方向情報融合を導入し、クロスモーダル特徴融合のボトルネックを解消する新しいネットワークを提案した。
原題: Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation / Biaoyu Ren, Qingsheng Wang, Cun Xu 他
日本語で読む → - 論文生成モデル機械学習
生成事前分布を超えて:JEPAガイド拡散によるマイノリティサンプリング
実世界の意味的希少性に基づくマイノリティサンプリングを実現するため、JEPA(世界モデル)のガイダンスを拡散モデルに組み込む手法を提案。近似戦略と理論的誤差限界により計算コストを削減し、様々な生成タスクで有効性を実証した。
原題: Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion / Sol Park, Soobin Um
日本語で読む → - 論文生理信号/認知状態推定機械学習
Synheart Capacity:ウェアラブル信号からの認知容量ダイナミクスの理論駆動型生理学的表現
心臓と皮膚電気活動の信号から、努力とストレスの2次元状態として認知容量を推定する理論駆動のマルチモーダル学習フレームワークを提案し、SWELL-KWデータセットで個人間一般化を実証した。
原題: Synheart Capacity: A Theory-Driven Physiological Representation of Cognitive Capacity Dynamics from Wearable Signals / Yisak Debele, Henok Ademtew, Israel Goytom
日本語で読む → - 論文世界モデル画像認識
群作用としての世界モデル
ビデオ世界モデルの行動忠実性を群構造に基づいて定式化し、潜在空間正則化により一貫性を向上させる手法を提案した論文。
原題: World Models as Group Actions / Zijie Wang, Wei Zhang, Weiming Zhang 他
日本語で読む → - 論文シミュレーション画像認識
DexSIM: 統一因果ビデオ拡散によるリアルタイム器用操作シミュレーション
手と物体のインタラクションをリアルタイムでシミュレートするため、ビデオ拡散モデルを用いた2段階学習フレームワークを提案。空間メモリを保持し、長時間の一貫性と3D認識を実現する。
原題: DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion / Adam Lee
日本語で読む → - 論文セキュリティ/LLMcs.CR
見張り塔への毒:敵対的ログ内容によるLLM拡張セキュリティ運用へのプロンプトインジェクション攻撃
セキュリティ運用センターでログを分析するLLMに対し、攻撃者が制御可能なログフィールドを介してプロンプトインジェクションを行う新たな攻撃分類を提案し、実験でその有効性と防御の限界を評価した。
原題: Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content / Rohan Pandey, Archit Bhujang
日本語で読む →