論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/28 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文認識論AI
認識論的シゾロジアと技術記号機械としての大規模言語モデル
大規模言語モデルが引き起こす「エピステミア」現象を、人間の認識実践との比較ではなく、記号過程の自動化として捉え直し、新たな認識論的枠組みを提案する論文。
原題: Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines / Federico Cabitza, Gianluca Colombo
日本語で読む → - 論文ディープフェイク/敵対的攻撃/検出画像認識
敵対的ディープフェイク生成と浄化ベース敵対的検出の調査
ImageCLEF 2026のディープフェイク生成・検出タスクに参加し、FLUX.1-devとPuLIDによる顔合成と多モデルPGD攻撃で生成スコア0.4170を達成。検出ではSigLIP+DINOv2とGenD-DINOv3のアンサンブルで精度99.4%を達成しつつ、浄化ベースの敵対的検出も独自に調査した。
原題: Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection / Junghyun Kim, Seunghyun Kim, Jiyoung Woo
日本語で読む → - 論文ビデオ編集画像認識
ビデオオブジェクト挿入とレイヤー分解のための明示的レイヤーモデリング
合成・背景・前景の3層からなる大規模データセットと、RGB合成とRGBA前景レイヤーを同時生成する二重分岐拡散モデルを提案し、ビデオオブジェクト挿入とレイヤー分解の性能を向上させた。
原題: Explicit Layer Modeling for Video Object Insertion and Layer Decomposition / Kyujin Han, Seungjoo Shin, Sunghyun Cho
日本語で読む → - 論文RAGセキュリティ機械学習
RAGuard: データポイズニングに対する検索拡張生成システムの多層防御フレームワーク
検索拡張生成(RAG)システムを対象とした、コーパスへの悪意ある文書注入攻撃(データポイズニング)に対する多層防御フレームワークを提案。敵対的検索器の微調整と、ラベル不要のブラックボックスフィルタ(ZKIP)を組み合わせ、攻撃成功率を実質ゼロに抑える。
原題: RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning / Pushkal Kumar, Tucker Nielson, Tanish Kolhe 他
日本語で読む → - 論文セキュリティcs.CR
意思決定レベルでの乗っ取り:ビット反転攻撃による大規模言語モデルへの認知バイアス注入
大規模言語モデルの重みの一部ビットを反転させるだけで、モデルの認知傾向を操作し、下流の意思決定に影響を与える攻撃手法を提案した論文。
原題: Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks / Yu Yan, Jiahao Chen, Siqi Lu 他
日本語で読む → - 論文画像フォレンジック画像認識
BG-REAL: 背景操作の検出と位置特定のための公開実データアンカー型ベンチマーク
背景操作の検出・位置特定に特化した公開ベンチマークBG-REALを構築し、既存のベースラインで再エンコードによる誤検出が共通の課題であることを示した。
原題: BG-REAL: A Public Real-Data Anchored Benchmark for Background Manipulation Detection and Localization / Bugra Alperen Uluirmak, Rifat Kurban
日本語で読む → - 論文ステレオ深度推定画像認識
WHTMix: ウォルシュ・アダマール変換による効率的なステレオ深度推定
ステレオトランスフォーマーの自己注意機構をデータ非依存のウォルシュ・アダマール変換に置き換え、計算量と遅延を大幅に削減しつつ精度を維持する手法を提案。
原題: WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing / Prathyush Sajith, Emadeldeen Hamdan, Ahmet Enis Cetin
日本語で読む → - 論文BMI/脳波デコードHCI
EEGForceFusion: 被験者非依存の把持力デコードのための共同トークン化・連続表現学習
脳波から把持力を高精度に推定するため、連続表現とトークン化表現を融合したハイブリッドデコードフレームワークを提案し、被験者非依存の汎化性能を実証した。
原題: EEGForceFusion: Joint Tokenised-Continuous Representation Learning for Subject-Independent Grasp Force Decoding / Sankalp Sunil Turankar, Yogesh Kumar Meena
日本語で読む → - 論文画像編集画像認識
何を編集できるのか?オープンエンドな戦略発見と感情編集可能性のランドスケープ
感情画像編集を「どう編集するか」ではなく「何を編集できるか」と捉え直し、画像固有の編集可能領域を発見するマルチエージェントフレームワークEmoScopeを提案。大規模な人間評価で既存手法を上回る性能を示した。
原題: What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape / Qing Li, Zeyu Dong, Yin Cui 他
日本語で読む → - 論文水中ロボット/制御画像認識
水中マニピュレータ用オイル充填電動関節システムの環境圧力補償とロバスト位置制御
水中マニピュレータの関節が受ける高圧環境に対応するため、圧力補償モジュールの動特性を解析し、関節構造を最適化して内部油圧を密封。不確かさを考慮した動的モデルを構築し、μ合成法に基づくロバスト位置制御器を設計・実験で検証した。
原題: Ambient pressure compensation and robust position control of oil-filled electric joint systems for underwater manipulators / Hongrui Wu, Songhui Wang, Xin Wang
日本語で読む → - 論文顔年齢認証画像認識
単純な外見操作に対する顔年齢認証の脆弱性
オンラインプラットフォームの年齢認証システムが、口ひげや口紅などの簡単な外見操作でどの程度騙されるかを体系的に調査した論文。7つのモデルを3つのデータセットで評価し、特定の操作で最大61%の未成年が成人と誤認されることを示した。
原題: Face Age Verification Vulnerabilities Under Simple Appearance Manipulations / Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos
日本語で読む → - 論文ナビゲーション画像認識
IMPRINT: 画像条件付きクエリ拡張によるロングテール物体ゴールナビゲーション
テキストのみのクエリに依存する既存の物体ゴールナビゲーション手法の限界を克服するため、ウェブから取得した画像でクエリを拡張し、視覚言語モデルを用いて意味マップと照合することで物体の位置特定精度を向上させるゼロショットフレームワークを提案した。
原題: IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation / Jelin Raphael Akkara, Filippo Ziliotto, Luciano Serafini 他
日本語で読む → - 論文VLA/推論高速化AI
動作認識型ベクトル量子化と重心再利用による効率的なVLA推論フレームワーク
VLAモデルの推論を高速化するため、ロボットの動作状態に応じて量子化精度を動的に調整し、コードブックの重心を再利用するGEMM計算を導入したアルゴリズム・ハードウェア協調設計を提案。
原題: A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference / Zhuoran Song, Haozhe Jiang, Chunyu Qi 他
日本語で読む → - 論文画像検出画像認識
DailyBench:現代の生成モデルによるAI生成・改変画像のための統合ベンチマーク
最新の生成モデルに対応した、AI生成画像と物体レベルの改変画像を評価する統合ベンチマークDailyBenchを提案し、既存の検出器の汎化性能が大幅に低下することを示した。
原題: DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models / Xin Jiang, Hao Tang, Junyao Gao 他
日本語で読む → - 論文エージェント計画自然言語
マルチターン長期間計画の物理:事前学習から事後学習まで、単一・複数教師によるオンポリシーエージェント蒸留を通じて
制御可能なマルチターン環境を導入し、事前学習と事後学習の各段階で長期間計画能力がどのように獲得・形成されるかを体系的に研究した論文。
原題: The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation / Tianyi Men, Zhuoran Jin, Kang Liu 他
日本語で読む → - 論文映像編集画像認識
CameraAnything: 任意のカメラ制御による映像の再撮影
カメラの内部・外部パラメータを同時に制御できる映像編集の統一フレームワークを提案し、焦点距離や解像度の変更を伴う再撮影を単一の生成プロセスで実現した。
原題: CameraAnything: Refilming Videos with Arbitrary Camera Control / Yixuan Li, Yanhong Zeng, Ka Leong Cheng 他
日本語で読む → - 論文姿勢追跡画像認識
オクルージョンと高速物体運動下での自己回復機能を備えた頑健な6-DoF物体姿勢追跡
RGB-Dデータを用いた未学習物体の6-DoF姿勢追跡において、学習ベースのキーポイントマッチングと最適化ベースの位置合わせを組み合わせ、追跡失敗の検出と自動回復を行うモジュールを新たに提案した。オクルージョンや高速運動下でも頑健に追跡を継続できる。
原題: Robust 6-DoF Object Pose Tracking with Built-In Recovery under Occlusions and Rapid Object Motions / Balázs Opra, Léo Ghafari, Thomas Stewart 他
日本語で読む → - 論文医用画像分割画像認識
SAM3のパラメータ効率的適応によるプロンプト駆動手術領域分割
手術画像の領域分割のために、SAM3のプロンプトエンコーダ等にLoRAを注入し、全パラメータの0.98%のみを最適化する軽量適応手法を提案した。
原題: Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation / Changjing Liu, Yiming Huang, Beilei Cui 他
日本語で読む → - 論文評価/空間認知AI
MetaSpace: 具身エージェントの空間認知のためのメタモルフィックテスト
具身エージェントの空間認知能力を評価するため、ソフトウェア工学のメタモルフィックテスト原理に基づくフレームワークMetaSpaceを提案し、実軌跡から自動生成したテストケースで空間認知エラーを検出する。
原題: MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents / Gengyang Xu, Dongwei Xiao, Yiteng Peng 他
日本語で読む → - 論文選好最適化機械学習
信頼性スイッチを組み込む選好最適化:反発・更新・拒絶の三方向契約
情報源の信頼性に応じて反発・更新・拒絶を切り替える能力を、信頼性を明示したデータで選好最適化することによりモデルに獲得させる手法を提案し、その有効性を検証した。
原題: Resist, Update, Reject: Preference Optimization Installs a Prior-Dependent Reliability Switch / Sen Yang, Yuen-Hei Yeung
日本語で読む → - 論文LLMエージェント機械学習
AllocBench: LLMエージェントにおけるオンラインツール割り当て能力の測定
LLMエージェントが限られた予算内で再利用可能なツールを効率的に作成・割り当てできるかを測るベンチマークを提案し、最先端モデルが抽象的な課題では最適に近い行動をする一方、コード作成タスクではその能力を転移できないことを示した。
原題: AllocBench: Measuring Online Tool Allocation Capability in LLM Agents / Daniel Wang, Andrew Xu
日本語で読む → - 論文VLAcs.MM
CTAN: 音視覚身体性ナビゲーションのための循環時間的注意ネットワーク
音と視覚の情報を双方向の循環一貫性制約で融合し、時間的記憶機構で履歴を活用する音視覚ナビゲーション手法を提案。
原題: CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation / Teng Liu, Yinfeng Yu
日本語で読む → - 論文sim2realcs.GR
3Dガウススプラッティングの明示的パラメータ摂動によるメッシュレスドメインランダム化
メッシュを使わずに3Dガウススプラッティングのパラメータを摂動させてランダム化データセットを生成する手法を提案。
原題: Meshless Domain Randomization via Explicit Parameter Perturbation of 3D Gaussian Splatting / Felipe Nunes Carbone de Carvalho, Joyce de Morais Souza, Alan de Aguiar 他
日本語で読む → - 論文物理特性推論画像認識
SiPhy: 単一画像からの物理特性推論
1枚のRGB画像から質量や剛性などの物理特性を推定する統一フレームワークSiPhyを提案。3D視覚情報と言語ベースの材料知識を組み合わせ、既存の多視点再構成法を上回る精度を達成した。
原題: SiPhy: Single-Image Physical Property Reasoning / Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada 他
日本語で読む → - 論文世界モデル機械学習
制御された世界モデルの識別可能性について
この論文は、ガウス潜在状態を持つ制御された世界モデルが非線形観測から復元可能かどうかを理論的に解析し、識別可能性の条件を提案しています。
原題: On the Identifiability of Controlled World Models / Xiangteng Zhang, Yang Guan, Bo Zhang 他
日本語で読む → - 論文進化計算/コード生成/身体性タスク機械学習
MEMENTO: 記憶誘導型メメティックコード・アズ・ポリシー進化
長期にわたる身体性タスク向けに、LLMを用いた進化的探索でコードとして表現されたポリシーを改善する手法を提案。評価器と記憶誘導の局所改善を組み合わせ、既存手法より高い成功率と汎化を達成した。
原題: MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution / Alkis Sygkounas, Victor Aregbede, Amy Loutfi 他
日本語で読む → - 論文説明可能性/生成モデルHCI
拡散モデルをアートに開く:インタラクティブなモデル操作と実践に基づく説明可能性
大規模テキストから画像を生成する拡散モデルを、アーティストが素材として扱えるよう内部構造を可視化・操作可能にする手法を提案し、ComfyUI上で層選択や介入操作を実装して効果を検証した。
原題: Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability / Ahmed M. Abuzuraiq, Philippe Pasquier
日本語で読む → - 論文ディープフェイク検出画像認識
説明可能なディープフェイク検出チャレンジ
ディープフェイク検出の判定根拠を説明する能力を競うチャレンジを紹介し、画像分類と自然言語による説明生成の両方を評価するベンチマークを提案している。
原題: Explainable Deepfake Detection Challenge / Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh 他
日本語で読む → - 論文強化学習機械学習
階層的アクションチャンキングを用いたオフライン強化学習
オフライン目標条件付き強化学習において、高レベルの潜在プランニングと低レベルのアクションチャンキングを組み合わせたHiQCを提案し、長期的タスクでの価値推定誤差を低減して性能を向上させた。
原題: Offline RL with Hierarchical Action Chunking / Ahad Jawaid
日本語で読む → - 論文遠隔操作/強化学習制御
関節柔軟性と時間変動遅延を有する遠隔操作マニピュレータの制御における適応ゲイン調整のための深層強化学習
関節の柔軟性と時間変動する通信遅延を持つ遠隔操作システムに対し、安定なP+dコントローラとTD3強化学習エージェントを組み合わせ、遠隔側の比例・減衰ゲインをリアルタイム調整して振動低減と追従性能向上を実現した。
原題: Deep Reinforcement Learning for Adaptive Gain Tuning in Control of Teleoperation Manipulators with Joint Flexibility and Time-Varying Delays / Armin Attarzadeh, Mohammad Ali Ghaemifar, Alireza Khanzadeh 他
日本語で読む →