論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/25 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文物理シミュレーション画像認識
PhysiFormer: ワールド空間での力学シミュレーション学習
3Dメッシュをワールド座標で表現し、拡散モデルを用いて物体の将来の頂点軌跡を予測する物理シミュレーション手法を提案。剛体・弾性体の力学を学習し、混合材料や未知形状にも汎化する。
原題: PhysiFormer: Learning to Simulate Mechanics in World Space / Yiming Chen, Yushi Lan, Andrea Vedaldi
日本語で読む → - 論文セキュリティ/RAGcs.CR
MIRROR: 新規性制約付きメモリ誘導MCTSによるエージェント型RAGのレッドチーミング
マルチモーダルなエージェント型RAGシステムに対する攻撃を、新規性制約とメモリ誘導MCTSを用いて統一的に探索するレッドチーミングフレームワークMIRRORを提案し、複数の攻撃面で高い成功率を達成した。
原題: MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG / Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya 他
日本語で読む → - 論文映像理解画像認識
信頼度を考慮したツール連携による堅牢な映像理解
映像推論モデルが入力フレームの劣化(ぼけや遮蔽など)を盲信する問題を指摘し、フレームごとの信頼度を推論に組み込むエージェント型フレームワークRobust-TOを提案した。
原題: Confidence-Aware Tool Orchestration for Robust Video Understanding / Yangfan He, Yujin Choi, Jaehong Yoon
日本語で読む → - 論文物体認識画像認識
未知の物体を識別する:ロボット物体操作のためのプロンプト不要なオープンボキャブラリ異常認識
ロボットが未知の物体を認識できるように、異常検出用MAEとプロンプト不要のオープンボキャブラリ分類器NOVICを組み合わせた二段階フレームワークAnomNOVICを提案し、テーブルトップ環境で高い精度を達成した。
原題: Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction / Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter
日本語で読む → - 論文データセット/広告検出機械学習
BetXplain: ソーシャルメディア上の操作的な賭博広告を検出するための説明付きデータセット
InstagramとRedditから収集した賭博関連広告を、操作・欺瞞的な広告手法のラベルと人間による説明付きで注釈したデータセットを構築し、その分析と検出フレームワークを提案した。
原題: BetXplain: An Explanation-Annotated Dataset for Detecting Manipulative Betting Advertisements on Social Media / MSVPJ Sathvik, Parmitha Vangapandu, Nishit Rane 他
日本語で読む → - 論文3Dシミュレーション画像認識
物理世界モデリングによる知覚的3Dシミュレーション
部分的な観測と不完全な3D変換信号から将来のシーン状態を予測する物理世界モデリングシステムP3Simを提案した。
原題: Perceptual 3D Simulation With Physical World Modeling / Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh 他
日本語で読む → - 論文画像編集画像認識
RoPEMover: 位置埋め込みによる深度認識オブジェクト移動
拡散トランスフォーマーの回転位置埋め込みを深度対応に拡張し、単一画像内のオブジェクトを幾何学的に一貫した移動を実現する手法を提案した。
原題: RoPEMover: Depth-Aware Object Relocation via Positional Embeddings / Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy 他
日本語で読む → - 論文画像検出画像認識
TruEye: 画像中のAI生成人物の高精度検出
AI生成画像の人物とシーンを5つの合成カテゴリに分類し、位置特定も行う新しい検出モデルを提案。LLMを使わずに高速で解釈可能な予測を実現。
原題: TruEye: Fine-Grained Detection of AI-Generated Human Subjects in Images / Jay Barot, Dan Lin
日本語で読む → - 論文安全性/モデレーションAI
安全ガードレールは推論を必要とするか?LeanGuard:堅牢なモデレーションのための高速で軽量なアプローチ
安全ガードレールの推論チェーンが精度向上に寄与しないことを示し、推論を省いた軽量なエンコーダのみのガードレールLeanGuardを提案。同等精度で約100倍の推論計算削減を実現した。
原題: Do Safety Guardrails Need to Reason? LeanGuard: A Fast and Light Approach for Robust Moderation / Dongbin Na
日本語で読む → - 論文世界モデル機械学習
JEPAベース世界モデルの一般化理論
JEPA事前学習を条件付きスペクトルグラフ学習として定式化し、計画誤差との関連から有限サンプル一般化境界を導出した理論論文。
原題: A Generalization Theory for JEPA-Based World Models / Jingyi Cui, Qi Zhang, Hongwei Wen 他
日本語で読む → - 論文データセット画像認識
PhysEditWorld: 物理編集可能なワールドモデル向け大規模データセット
ゲームワールドモデルの物理ダイナミクスを制御可能にするため、重力パラメータを明示的に付与した大規模マルチモーダルデータセットを構築した。
原題: PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models / Bin Hu, Yanwen Ma, Jiehui Huang 他
日本語で読む → - 論文セキュリティcs.CR
DroidBreaker: 機械学習ベースのAndroidマルウェア検出器に対する実用的かつ機能的な問題空間攻撃
既存の問題空間攻撃の非実用性を指摘し、ビルド安全性と意味保存性を備えた新しい攻撃フレームワークDroidBreakerを提案した。
原題: DroidBreaker: Practical and Functional Problem-Space Attacks on Machine-Learning Android Malware Detectors / Christian Scano, Diego Soi, Angelo Sotgiu 他
日本語で読む → - 論文カメラプランニングAI
動く前に見る:動的3Dストーリーワールドにおける物語に基づく視覚的注意
動的3D環境でのカメラプランニングにおいて、観察すべき視覚情報を能動的に決定するフレームワークを提案し、物語意図と物理的制約を満たす視点選択と軌道生成を行う。
原題: Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds / Jiaming Bian, Bingliang Li, Yuehao Wu 他
日本語で読む → - 論文敵対的検出画像認識
AEGIS:ビジョンセンサにおける堅牢な敵対的検出のための意味的GANと証拠学習フレームワーク
敵対的攻撃に脆弱な視覚センサのDNNを守るため、意味的整合性を検査するGANと、不確実性を考慮した証拠深層学習を組み合わせた敵対的入力検出フレームワークAEGISを提案した。
原題: AEGIS: A Semantic GAN and Evidential Learning Frameworkfor Robust Adversarial Detection in Vision Sensors / Maher Boughdiri, Mounira Msahli, Albert Bifet
日本語で読む → - 論文最適化機械学習
球面ブラックボックス最適化手法の架け橋
進化戦略やコンセンサスベース最適化など複数のブラックボックス最適化手法を統一的枠組みで捉え、その設計選択を明らかにし、性能とロバスト性のトレードオフを制御できるハイブリッド手法を提案した。
原題: Bridging Spherical Black-Box Optimizers / Johannes Ackermann, Stefano Peluchetti
日本語で読む → - 論文視覚追跡画像認識
統一空間意味プロンプトによる身体化視覚追跡と潜在ダイナミクス学習
身体化視覚追跡において、言語のみのターゲット指示では曖昧さが生じる問題を解決するため、空間的・意味的プロンプトを統合したフレームワークUSSを提案し、実ロボット実験で有効性を示した。
原題: USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning / Yuchen Xie, Xinyu Zhou, Kuangji Zuo 他
日本語で読む → - 論文仮想試着画像認識
TryOnCrafter: レンダリング可能な4D試着プロキシによるカメラ軌道を活用した現実的なビデオ仮想試着
従来のビデオ仮想試着はカメラ軌道に依存していたが、任意のカメラ移動に対応できる新しいタスクCaM-VVTを定義し、4D試着プロキシとDiTベースのフレームワークで解決する。
原題: TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy / Hao Sun, Hao Yan, Mengting Chen 他
日本語で読む → - 論文AI安全性AI
解雇不能なセーフティカーネル:AIエージェントと他の脱出可能なAIシステムのための実行時AIアライメント
AIエージェントの制御をエージェント自身のランタイム内に置くのではなく、プロセス分離や事前強制などの特性を満たす外部の認可層(セーフティカーネル)を提案し、Rustで実装して形式的検証を行った。
原題: The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems / Seth Dobrin, Łukasz Chmiel
日本語で読む → - 論文ビュー合成画像認識
胃内視鏡ビュー合成:新しい実データセットと評価
胃内視鏡画像の新規ビュー合成のための実データセットGastroNVSを初めて提供し、3Dガウススプラッティング手法の評価と課題を議論した。
原題: Gastroendoscopy View Synthesis: A New Real Dataset and Evaluation / Masaki Minai, Yusuke Monno, Masatoshi Okutomi 他
日本語で読む → - 論文強化学習機械学習
万能解を超えて:オフライン事前知識を用いた診断駆動型オンライン強化学習
オフライン事前知識の活用が強化学習に不可欠となる一方、その有効性は環境や学習過程で変化するため、単一の管理手法は最適でないと主張し、展開固有の証拠に基づく診断駆動型の緊張管理への転換を提案する論文。
原題: Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors / Guozheng Ma, Lu Li, Zilin Wang 他
日本語で読む → - 論文シミュレーション/知覚画像認識
RadarTwin: 特定環境向けミリ波レーダーシミュレーションと屋内認識のための学習
実データ収集前に、対象空間の3D再構成からレーダー関連の表面材質を推定し、物理ベースのレイトレーシングでFMCWレーダー測定を合成するフレームワークを提案。シミュレーションと実データの特徴が一致し、シミュレーションのみで学習した表現が実物体を偶然の2.5倍の精度で認識、少数のラベルで95.3%に向上することを示した。
原題: RadarTwin: Scene-Specific mmWave Radar Simulation and Learning for Mobile Indoor Perception / Emily Bejerano, Federico Tondolo, Devang Gupta 他
日本語で読む → - 論文VLAAI
iFLYTEK-Embodied-Omni技術報告
視覚・言語・行動を単一のOmniフレームワークで統合したマルチモーダル基盤モデルを提案し、脳と小脳の協調に例えられる設計で、指示理解から行動生成までを一貫して行う。
原題: iFLYTEK-Embodied-Omni Technical Report / Yuan Zhang, Jingfei Ni, Guanchen Lu 他
日本語で読む → - 論文手の姿勢推定画像認識
ScaleHP: メートル空間での手の姿勢推定
手の骨の比例関係からメートル単位の手のサイズを推定し、深度モジュールなしで絶対スケールの手の姿勢を高精度に復元する新しいフレームワークを提案した。
原題: ScaleHP: Estimating Hand Pose in Metric Space / Ruitao Jing, Xingyu Chen, Hongyang Li 他
日本語で読む → - 論文セキュリティ/連合学習cs.CR
色が重要:連合バックドア攻撃の成功率に影響を与えるトリガーの色
連合学習におけるバックドア攻撃で、トリガーの意味や配置を変えずに色だけを変えると攻撃成功率が大きく変わることを示し、色が攻撃効果に与える影響を分析した論文。
原題: Color Matters: Trigger Color Affects Success in Federated Backdoor Attacks / Kavindu Herath, Joshua C. Zhao, Saurabh Bagchi
日本語で読む → - 論文ビデオ生成/拡散蒸留画像認識
Causal-rCM: ストリーミング動画生成と対話型ワールドモデルのための自己回帰拡散蒸留における教師強制と自己強制の統一的オープンレシピ
自己回帰ビデオ拡散モデルに対して、拡散蒸留フレームワークrCMを拡張し、教師強制と自己強制の相補性を活用した統一的な蒸留手法Causal-rCMを提案。カスタムマスクFlashAttention-2 JVPカーネルにより連続時間CMを実装し、10倍の収束高速化と最先端のストリーミング動画生成性能を達成した。
原題: Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models / Kaiwen Zheng, Guande He, Min Zhao 他
日本語で読む → - 論文3D再構成画像認識
PRISM: 幾何学的ワープ残差モデリングによる単一画像からのフィードフォワード3D再構成
単一画像から3Dシーンを再構成する際、幾何学的な前方ワープで大部分をカバーし、残りの残差のみを学習するフィードフォワード手法を提案。拡散モデルを使わずに高速で高品質な再構成を実現した。
原題: PRISM: Feed-Forward Single-Image 3D Reconstruction via Geometric Warp-Residual Modeling / Zhijie Zheng, Xinhao Xiang, Jiawei Zhang
日本語で読む → - 論文物体検出画像認識
VistaRef: 指差し物体検出のための視覚的空間方位認識の強化
指差しジェスチャーによる物体検出の精度を高めるため、手の姿勢エンコーディングと幾何学的レイモデリングを導入し、空間方位認識を明示的に強化するフレームワークを提案した。
原題: VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection / Ling Li, Zhizhen Cai, Xinkun Wu 他
日本語で読む → - 論文制御math.OC
時間スケール分離による準最適・低次元MPC
最適化の反復回数を制限し、低次元モデルを用いることでリアルタイム性を確保する非線形MPCの枠組みを提案し、十分に速いサンプリングで閉ループの安定性を保証する。
原題: Suboptimal and Reduced-Order MPC via Timescale Separation / Stefano Di Gregorio, Guido Carnevale, Giuseppe Notarstefano
日本語で読む → - 論文画像フォレンジック画像認識
ForensicsTok: フォレンジック誘導トークン化モデリングによる画像改ざん位置特定
画像改ざん位置特定を自己回帰シーケンス生成として再構成し、トークンを直接マスクに変換する新しいデコーダと階層的専門家融合を導入して、MLLMベースの手法の精度を向上させた。
原題: ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization / Lei Xu, Haowei Wang, Shen Chen 他
日本語で読む → - 論文モデル予測制御制御
将来情報を考慮したMDPのMPCによる解法
将来情報を含むMDPに対して、パラメータ化されたMPCが最適方策を表現できる構造的条件を示し、RLでパラメータを学習する手法を提案した。
原題: Solving Markov Decision Processes with Future Information via MPC / Shambhuraj Sawant, Akhil S Anand, Dirk Reinhardt 他
日本語で読む →