論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/23 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文画像編集画像認識
EPEdit:生成AIとユーザー中心設計による画像編集の再定義
画像編集のためのアプリケーションEPEditを提案。Stable Diffusionベースのゼロショット編集アルゴリズムを用い、追加のファインチューニングなしで多様な編集タスクを実現する。
原題: EPEdit: Redefining Image Editing with Generative AI and User-Centric Design / Hoang-Phuc Nguyen, Dinh-Khoi Vo, Trong-Le Do 他
日本語で読む → - 論文LLMエージェント安全性cs.SE
AutoSpec: 帰納論理プログラミングによるLLMエージェントの安全ルール進化
LLMエージェントの安全性を高めるため、専門家が設計したルールをユーザーの安全/不安全アノテーションから自動的に進化させるフレームワークAutoSpecを提案。反例誘導合成と帰納論理プログラミングを用いて、解釈可能なルールを精度と再現率のバランスを保ちながら生成する。
原題: AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming / Pingchuan Ma, Zhaoyu Wang, Zimo Ji 他
日本語で読む → - 論文最適化/通信AI
エージェント型AIによるポリシー駆動物理層システムの二段階長期最適化
ネットワーク運用者のポリシー変化やリアルタイム制約に対応するため、エージェント型AIを用いた二段階最適化フレームワークを提案し、セルフリーMIMOビームフォーミングで長期性能を57.2%向上させた。
原題: Agentic AI for Bilevel Long-Term Optimization of Policy-Driven Physical Layer Systems / Bingnan Xiao, Chenhao Yang, Wei Ni 他
日本語で読む → - 論文ワールドモデル画像認識
自己進化型ワールドモデルのための反事実的制御可能性を備えた自律ビデオ生成
ビデオ生成モデルを自己進化型ワールドモデルへ発展させるため、介入条件付き未来生成、身体性制約への結合、分布シフト下での検証、生存ブランチの蒸留からなる4段階閉ループ最適化と対応する評価指標を提案した。
原題: Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models / Xin Wang, Wenxuan Liu, Tongtong Feng 他
日本語で読む → - 論文遠隔操作制御
人間らしいエンドエフェクタ遠隔操作のための人機共有制御
遠隔操作ロボットアームの動作を人間の手の動きの特性(2/3乗則)に合わせてリアルタイムに補正し、操作者の意図を保ちつつ人間らしい軌道を生成する手法を提案・実機検証した。
原題: Human-Robot Shared Control for Humanized End-Effector Teleoperation / Batool Ibrahim, Imad H. Elhajj, Daniel Asmar 他
日本語で読む → - 論文3次元シーン補完画像認識
3次元シーン補完のための深層学習アプローチ:幾何モデリングから生成的パラダイムへ
2016年から2026年までの3次元シーン補完に関する深層学習研究を体系的にレビューし、表現パラダイムの進化を分類・整理した論文。
原題: Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms / Afifa Khaled, Said Jadid Abdulkadir, Majdy Mohamed Eltayeb Eltahir
日本語で読む → - 論文AI安全性/説明可能性機械学習
見えざる手:標的型アイデンティティ再関連付け攻撃によるモデル公平性とSHAPの操作
機械学習モデルの公平性監査や説明可能性手法が、保護属性の影響を隠す巧妙な攻撃に対して脆弱であることを示し、モデル内部にアクセスせずに出力を操作する新たな攻撃手法を提案した。
原題: The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks / Sannaan Khan, Muhammad U. S. Khan
日本語で読む → - 論文VLA画像認識
AIR: MLLMにおけるコードを用いた適応的インターリーブ推論
マルチモーダル大規模言語モデルに、コードを介した数値計算タスクの適応的推論能力を強化学習で付与する手法を提案。
原題: AIR: Adaptive Interleaved Reasoning with Code in MLLMs / Cong Han, Xiaohan Lan, Haibo Qiu 他
日本語で読む → - 論文VLM安全性評価画像認識
REALM: 物理世界VLMのための統合レッドチーミングベンチマーク
物理世界のVLMの脆弱性を評価するための、攻撃手法・防御・モデルを統一的に比較できる初のベンチマークを提案した。
原題: REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs / Yifei Zhao, Qian Lou, Mengxin Zheng
日本語で読む → - 論文物体姿勢推定画像認識
任意参照からのモデルフリー物体姿勢推定:PANY
CADモデルや追加学習なしで、任意の参照画像から未知物体の6D姿勢を推定する統一フレームワークPANYを提案。RGBとRGB-Dの両対応で、単一または疎な参照ビューから頑健に姿勢を推定する。
原題: Pose Anything Anywhere:Model-free Object Poses from Arbitrary References / Hongli Xu, Jiaqi Hu, Junwen Huang 他
日本語で読む → - 論文インタラクション生成画像認識
IMAGIN-4D: 画像誘導による制御可能なインタラクション生成
参照画像を用いて人間と物体のインタラクション生成の曖昧さを解消する拡散モデルを提案。画像条件を空間的・時間的に分解し、役割別の条件付けで制御性を高めた。
原題: IMAGIN-4D: Image-Guided Controllable Interaction Generation / Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin 他
日本語で読む → - 論文VQA/接地型推論画像認識
学習可能なプロキシトークンによる忠実な接地型視覚推論
マルチモーダル大規模言語モデルにおいて、座標ではなく学習可能なプロキシトークンで画像領域を指し示す新しい接地機構を提案し、推論の一貫性と接地精度を向上させた。
原題: Faithful Grounded Visual Reasoning via Learned Proxy-Tokens / Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo 他
日本語で読む → - 論文動画表現学習画像認識
P-JEPA: 手続き動画のための関節埋め込み予測アーキテクチャによる表現学習
長時間の手続き動画を理解するため、フレーム整列された行動空間への密な予測とマスク潜在ベクトルのプーリングにより、30分超の動画を扱えるバックボーン非依存の表現学習手法P-JEPAを提案した。
原題: P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture / Felix Tristram, Stefano Gasperini, Benjamin Killeen 他
日本語で読む → - 論文HOI生成画像認識
ポリシーをデータとして:シミュレーション物理から一般化可能なHOI拡散モデルを学習する
物理シミュレータで強化学習により訓練したポリシーを用いてタスク指向のデータを生成し、そのデータで拡散モデルを訓練することで、未見物体への一般化と長期的な物理整合性を持つ人間-物体インタラクション生成を実現する。
原題: Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics / Shujia Li, Jianshu Hu, Haiyu Zhang 他
日本語で読む → - 論文VLA/セキュリティ機械学習
信頼された想像への攻撃:想像してから行動する世界モデルに対するオラクルレベルの整合性攻撃
想像してから行動するVLAポリシーにおいて、世界行動モデルが生成する未来の潜在軌道を攻撃対象とし、観測摂動による非標的破壊が容易であることを示し、パラメータフリーの検出器を提案した。
原題: Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models / Linghan Chen, Kaiyan Ji, Minyu Guo
日本語で読む → - 論文画像生成cs.GR
変換ロータリー位置埋め込み拡張拡散モデルによる制御可能なテクスチャタイリング
拡散トランスフォーマーを用いて、ユーザー指定のテクスチャをシーン画像に繰り返し配置する際に、周波数・向き・スケールを精密に制御しつつ、参照テクスチャの構造とシーンの照明・幾何を保つ新しいフレームワークを提案した。
原題: Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models / Junrong Huang, Zhiyuan Zhang, Rui Tang 他
日本語で読む → - 論文画像生成画像認識
速度編集による安全な少数ステップ生成
フローマッチングを用いたテキスト画像生成において、安全条件付き後方分布に基づいて速度場を直接編集し、プロンプトを変えずに安全な出力へ軌道を誘導するトレーニング不要の手法VESFlowを提案した。
原題: Safe Few-Step Generation via Velocity Editing / Yujin Choi, Jaehong Yoon
日本語で読む → - 論文ディープフェイク検出画像認識
LoCC: 反事実フレーム整合性によるリップシンクディープフェイクの検出と位置特定
リップシンクディープフェイクの検出と位置特定を行う新しいフレームワークLoCCを提案。時間的近傍から生成した反事実推定との整合性を評価し、フレームレベルの不一致を捉える。
原題: LoCC: Detection and Localization of Lip-Syncing Deepfakes via Counterfactual Frame Consistency / Soumyya Kanti Datta, Shan Jia, Siwei Lyu
日本語で読む → - 論文文書画像解析画像認識
多レベル差分特徴と統合DCT量子化埋め込みによる効率的な文書改ざん位置特定
文書改ざんの位置特定を目的とし、RGB-DCT早期融合アーキテクチャDiffNetを提案。多レベル差分変換と軽量なDCTドメインバックボーンにより、クロスドメイン性能とDCTバックボーン設計を改善した。
原題: Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding / Mohamed Dhouib, Ye Zhu, Sonia Vanier 他
日本語で読む → - 論文VLA画像認識
PolicyTrim: 視覚言語行動モデルの本質的なポリシー効率を高める
VLAモデルの実行効率を、推論遅延ではなく行動チャンクの有効長と物理ステップ数に着目して改善する強化学習ベースの後訓練フレームワークを提案した。
原題: PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models / Xianghui Wang, Feng Chen, Wenbo Zhang 他
日本語で読む → - 論文VLA/行動理解画像認識
ゴールドポイントスナイパー:微細な行動理解のためのVLMにおける自己誘導型視覚推論
ロボットが広視野画像中の小さな人物の微細な行動を理解するため、軽量VLMに自己誘導型のマルチモーダル推論を組み込むフレームワークGPSを提案し、行動関連の重要点抽出、自己質問による検証、意味的含意評価で精度と事実整合性を向上させた。
原題: Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding / Haodi Liu, Xinhang Yang, Kunda Yan 他
日本語で読む → - 論文自動運転/自己教師あり学習画像認識
ラベルなし運転シナリオ複雑度検出のための統合埋め込み予測アーキテクチャ
ラベルなしデータから運転シナリオの複雑さを自己教師ありで検出する手法を提案。JEPAモデルの予測誤差を複雑度スコアとして用い、複雑なシナリオを高スコアで識別できることを示した。
原題: Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture / Santosh Jaiswal
日本語で読む → - 論文因果推論自然言語
言葉が違いを生む:大規模言語モデルがテキスト中の因果構造をどう決定するか
大規模言語モデルがテキストから因果構造を学習する仕組みを、変分帰納法という違いを生む論理に基づいて説明する論文。
原題: Words as Difference Makers: How Large Language Models Determine Causal Structure in Text / Wolfgang Pietsch
日本語で読む → - 論文計画/シンボリック推論AI
SCOPE: オープンエンド環境における計画のためのシンボリック世界の進化
視覚言語モデルと古典的プランナーを統合した計画手法において、不完全なシンボリック表現を自己適応的に進化させるフレームワークSCOPEを提案し、環境摂動下での計画成功率と適応性を向上させた。
原題: SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments / Yundaichuan Zhan, Minghe Gao, Zhongqi Yue 他
日本語で読む → - 論文ナビゲーション画像認識
FlowDec: 時間的条件付きフロー修復による頑健な連続環境視覚言語ナビゲーション
連続環境での視覚言語ナビゲーション(VLN-CE)において、実世界の視覚劣化に対する頑健性を高めるため、時間的文脈を活用した画像修復フレームワークFlowDecを提案した。
原題: FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation / Yufei Zhang, Changhao Chen
日本語で読む → - 論文エージェントAI/理論AI
接地されたスケーリング:エージェント型AIには決定論的環境が必要な理由
エージェント型AIの長いタスク連鎖は、環境の非決定性により指数関数的に失敗することを示し、環境の決定性がスケーリングの重要な軸であると主張する。決定性効率限界などの形式的結果と、供給確実性指数や決定性成熟度モデルを提案する。
原題: Grounded Scaling: Why Agentic AI Needs Deterministic Environments / Liang Ding, Xintong Wang
日本語で読む → - 論文連合学習/セキュリティ機械学習
SCRUB-FL: バックドアの忘却による表現の浄化とクレンジング
連合学習におけるバックドア攻撃を、訓練中に疑わしいサンプルを検出し、収束後に生成モデルで近似したトリガーを用いて機械忘却を適用することで除去する二段階の防御手法を提案した。
原題: SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors / Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab 他
日本語で読む → - 論文ベンチマーク画像認識
T-IMPACT: 文脈を考慮した画像・テキスト操作の重大度認識ベンチマーク
ニュース風の画像とテキストのペアに対する操作の重大度を評価する新しいベンチマークを提案し、既存モデルが真正性はある程度検出できるが、重大度予測は人間の判断とあまり一致しないことを示した。
原題: T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation / Gagandeep Singh, Aaditya Yadav, Priyanka Singh
日本語で読む → - 論文環境モデリング機械学習
VegSim: シナリオ条件付き植生シミュレーションのための地理空間ワールドモデル
気候ストレス下での植生モニタリングのために、観測された気象だけでなく任意の気象シナリオに対する植生応答をシミュレーションできる地理空間ワールドモデルVegSimを提案した。
原題: VegSim: A Geospatial World Model for Scenario-Conditioned Vegetation Simulation / Irene Iele, Elena Mulero Ayllón, Paolo Soda 他
日本語で読む → - 論文エージェントメモリAI
信念ベースのエージェントメモリはいつ役立つのか?信頼性条件付き更新と出典上限付きポイズニング防御
大規模言語モデルエージェントの長期記憶において、ベイズ信念更新が有効となる条件を分析し、信頼性条件付き更新と出典上限付き防御を提案した。
原題: When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense / Pranav Singh
日本語で読む →