論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文空間推論画像認識
RoboSpatialチャレンジ技術報告:選択的推論活性化と参照フレーム曖昧性解消による身体化空間推論
CVPR 2026のRoboSpatialチャレンジで1位を獲得した、ロボットの空間推論を強化する推論時プロンプト手法を提案した論文。
原題: Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning / Yuxiang Xie, Qi Lv, Jianming Xing 他
日本語で読む → - 論文3次元再構成画像認識
CasaMaestro: 住宅規模の3次元再構成のためのマルチビューパノラマ
この論文は、少数のパノラマ画像から住宅全体の3次元再構成を行うフィードフォワードモデルCasaMaestroを提案している。
原題: CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction / Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang
日本語で読む → - 論文マルチエージェント協調cs.MA
MECoBench: 具現化環境におけるマルチモーダルエージェント協調の体系的研究
マルチモーダル大規模言語モデルを具現化エージェントとして協調させるためのベンチマークMECoBenchを提案し、多様な実世界タスクでの協調効果と限界を実験的に分析した。
原題: MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments / Qingyun Liu, Jiwen Zhang, Jingyi Hu 他
日本語で読む → - 論文画像編集画像認識
あらゆるものを一度に編集する
複数の画像編集指示を1回の推論で処理する新しい手法MICEを提案し、指示間の干渉を抑えて属性の混入を防ぎつつ、高品質な編集を実現した。
原題: Editing Everything Everywhere All at Once / Fabio Quattrini, Carmine Zaccagnino, Enis Simsar 他
日本語で読む → - 論文LLM安全性機械学習
競合する報酬によるLLMの過剰拒否への対処
安全トレーニングによる過剰拒否問題を、有害な推論を探索として活用しつつ安全な回答を生成する敵対的枠組みで解決する手法を提案した。
原題: Addressing Over-Refusal in LLMs with Competing Rewards / Taeyoun Kim, Aviral Kumar
日本語で読む → - 論文セキュリティ画像認識
パッチサイズを盗む:視覚言語モデルへの敵対的操作
ブラックボックス攻撃により、視覚言語モデルの隠れたパッチサイズや前処理設定を推測し、それを利用した敵対的攻撃を可能にする手法を提案した。
原題: Steal the Patch Size: Adversarially Manipulate Vision-Language Models / Kai Hu, Akash Bharadwaj, Weichen Yu 他
日本語で読む → - 論文VLA画像認識
基盤モデル連携の再考:代理タスク推論による特化モデルの強化
基盤モデルと特化モデルの協調をタスク分解として捉え、特化モデルの予測候補を基盤モデルが選択・検証する代理タスクで改善するフレームワークFATを提案。2D/3D物体検出、軌道予測、セマンティックセグメンテーションで効果を実証。
原題: Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning / Hongyi Lin, Yang Liu, Jinhua Zhao 他
日本語で読む → - 論文VLA/安全性評価画像認識
EgoSafetyBench:具身VLMをランタイム安全監視役として評価する診断用エゴセントリック動画ベンチマーク
ロボット視点の動画で、安全監視VLMが本当の危険を見逃さず、見かけだけの異常に過剰介入しないかを診断するベンチマークを構築し、10種のVLMを評価した。
原題: EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards / Siddhant Panpatil, Arth Singh, Mijin Koo 他
日本語で読む → - 論文CAD/LLMエージェントAI
具現化CAD:ソルバー基盤のLLMエージェントによるパラメトリックB-Repアセンブリモデリング
LLMエージェントがCADソルバーのフィードバックを利用して、パラメトリックB-Repアセンブリモデリングを段階的に実行するフレームワークを提案した。
原題: Embodied CAD: Solver-Grounded LLM Agents for Parametric B-Rep Assembly Modeling / Fumin Liu, Haoyu Zhou, Fei Hao 他
日本語で読む → - 論文3D理解画像認識
MV-GEL: 言語駆動によるメッシュ上の多視点幾何エンティティ位置特定
自然言語クエリに基づいて3Dメッシュ上の細かい幾何エンティティ(面、エッジ、立体)を特定するフレームワークを提案。視点選択を最適化し、VLMとレイキャスティングを組み合わせて高精度な位置特定を実現。
原題: MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes / Kartik Bali, Roland Aydin
日本語で読む → - 論文安全性/実行時監視AI
LabGuard: 実験室エージェントのための自然言語ルールを実行時ガードに変換する基盤
実験室の安全ルールなどの自然言語を実行可能な仕様に変換し、実行時モニタとして適用する安全スイートLabGuardを提案。未見ルールへの汎化や不安全イベント削減効果を実証した。
原題: LabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents / Jingpu Yang, Fengxian Ji, Zhengzhao Lai 他
日本語で読む → - 論文4D再構成画像認識
1本の動画から1つの世界へ:単眼動画を物理的な4Dシーンに変換する
単眼動画から、インスタンス単位で分離され、物理シミュレーションに利用可能な4Dメッシュシーンを、学習なしで再構成するシステムOVOWを提案する。
原題: One Video, One World: Turning Monocular Video into Physical 4D Scenes / Junhao Chen, Boran Zhang, Mingjin Chen 他
日本語で読む → - 論文ディープフェイク防御画像認識
ファントム:潜在空間と空間的制約を統合した統一フェイススワップディープフェイク防御フレームワーク
フェイススワップディープフェイクから個人のプライバシーを守るため、潜在空間と空間領域の両方で摂動を制約する統一防御フレームワーク「Phantom」を提案した。
原題: Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints / Jungkon Kim, Cheolseung Jung, Jong-Min Choi 他
日本語で読む → - 論文世界モデル/計画機械学習
AdaJEPA: 適応的潜在世界モデル
テスト時に世界モデルを適応させることで、分布シフト下での計画失敗を防ぐ手法を提案。MPCの閉ループ内で自己教師あり適応を行い、少数の勾配ステップで性能を大幅に改善する。
原題: AdaJEPA: An Adaptive Latent World Model / Ying Wang, Oumayma Bounou, Yann LeCun 他
日本語で読む → - 論文空間推論画像認識
AeroVerse-SatAgent: 認知神経科学の二重視覚経路理論に着想を得たUAV-衛星協調空間推論
UAVと衛星の協調による空間推論モデルSatAgentを提案し、幾何認識3D再構成エンコーダと多視点トポロジー意味アライメントで視点変化に頑健な推論を実現した。
原題: AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience / Wenyi Zhang, Fanglong Yao, Youzhi Liu 他
日本語で読む → - 論文物体検出画像認識
リアルタイムソースフリー物体検出
ドメインシフト下でのリアルタイム物体検出を実現するため、YOLOv10ベースの軽量なソースフリー適応手法を提案。二つのヘッドからの擬似ラベル融合とマルチスケール特徴の多様化損失により、精度・速度・パラメータ数を改善した。
原題: Real-Time Source-Free Object Detection / Sairam VCR, Varun Gopal, Poornima Jain 他
日本語で読む → - 論文拡散モデル/アンラーニング画像認識
拡散モデルのアンラーニングにおけるスパースオートエンコーダを用いた「見るが触れるな」アプローチ
拡散モデルの概念消去において、スパースオートエンコーダの潜在空間への直接介入はアーティファクトを生じるため、検出のみに用いて対象領域のパッチを置換する手法を提案し、よりクリーンな消去を実現した。
原題: Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models / Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed 他
日本語で読む → - 論文ワールドモデル機械学習
DreamForge-World 0.1 プレビュー:低計算コストでリアルタイム制御可能なワールドモデル
消費者向けGPUで動作する低計算コストのリアルタイム制御可能なワールドモデルのプレビュー版を提案し、キーボードやマウス操作によるインタラクティブなシミュレーションを実現した。
原題: DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model / Daniyel Ayupov, Artur Markov-Tsoy
日本語で読む → - 論文エージェント/蒸留/オンデバイス機械学習
DuoMem: 二重空間蒸留による高性能オンデバイスメモリエージェントの実現
大規模教師モデルの手続き的推論能力を、文脈空間とパラメータ空間の二重蒸留で小型モデルに転移し、リソース制約のあるデバイス上で高性能なメモリエージェントを実現した。
原題: DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation / Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami 他
日本語で読む → - 論文安全性評価機械学習
CAREBench: 言語モデルのための子どもの安全リスク評価ベンチマーク
子どもへの明示的な危害に発展する前の、操作や感情依存などの上流リスクを評価するベンチマークを構築し、7つの最先端モデルで失敗率2%〜58%を確認した。
原題: CAREBench: A Child-Safety Risk Benchmark for Language Models / Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson 他
日本語で読む → - 論文視覚認識/ショートカット学習画像認識
初期手がかり精度が視覚的ショートカット学習を形作る:制御された手がかり操作ベンチマークによる検証
視覚分類器が低レベルな手がかりに依存して失敗する現象が、学習初期の手がかり精度によってどう影響されるかを、合成タスクやCIFAR-10ベンチマークで体系的に検証した論文。
原題: Early Cue Precision Shapes Visual Shortcut Learning in Controlled Cue-Manipulation Benchmarks / Chanho Park, Woochan Lee, Janyeong Oh 他
日本語で読む → - 論文空間推論画像認識
OmniCoT:グローバルかつ多段階のパノラマ推論のためのベンチマーク
パノラマ画像におけるマルチモーダル大規模言語モデルの空間推論能力を評価・向上させるため、グローバルな証拠と多段階推論に焦点を当てたベンチマークOmniCoTを提案し、訓練データと評価データを整備した。
原題: OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning / Haocong He, Chenfei Liao, Zichen Wen 他
日本語で読む → - 論文セマンティック通信/セキュリティcs.NI
多元接続チャネル上のセマンティック通信に対する無線バックドア攻撃と防御
セマンティック通信システムにおいて、敵対者が低電力のトリガー波形を送信して特定送信機の推論を選択的に操作する攻撃を提案し、その防御法を開発した。
原題: Wireless Backdoor Attack and Defense for Semantic Communications over Multiple Access Channel / Yalin E. Sagduyu, Tugba Erpek, Aylin Yener 他
日本語で読む → - 論文手の動き再構築画像認識
ビデオ拡散モデルの手の動き再構築における驚くべき有効性
事前学習済みのビデオ拡散モデルの表現を活用し、自己中心視点のビデオから4Dの両手のポーズを再構築する手法を提案。検出器やテスト時最適化を不要とし、既存手法を大幅に上回る性能を達成した。
原題: The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction / Yuxi Wang, Chengkai Jin, Yufei Liu 他
日本語で読む → - 論文3D再構築画像認識
シェル教師付きガウススプラッティングによる都市の実-to-シム再構築
都市のファサードをビデオから3D再構築する際、ガラスや反射などで表面形状が不安定になる問題を、外部の構造シェルを幾何学的教師として用いることで解決する手法を提案した。
原題: Shell-Supervised Gaussian Splatting for Urban Real-to-Sim Reconstruction / Yuan Yang, Peijun Lu, Fangzhou Lu 他
日本語で読む → - 論文世界モデル画像認識
Orca:世界は心の中にある
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
原題: Orca: The World is in Your Mind / Yihao Wang, Yuheng Ji, Mingyu Cao 他
日本語で読む → - 論文トラッキング/セグメンテーション画像認識
SUMO: 非線形状態空間モデルによる任意の動きのセグメンテーションと追跡
視覚的手がかりに依存せず、ロボティクス由来の非線形状態空間モデルと選択的アンセンテッドフィルタを用いて、ゼロショットで動物体のセグメンテーションと追跡を統合するフレームワークを提案した。
原題: SUMO: Segment and Track Any Motion with Nonlinear State Space Models / Kexin Tian, Sixu Li, Keshu Wu 他
日本語で読む → - 論文戦略的分類/ロバスト最適化機械学習
意思決定依存コスト不確実性下でのロバスト戦略的分類
戦略的分類における操作コストが過去のアルゴリズム決定に依存する問題を、二段階ロバスト最適化と意思決定依存不確実性集合でモデル化し、ゲーミング抑制効果を解析した。
原題: Robust Strategic Classification under Decision-Dependent Cost Uncertainty / Sura Alhanouti, Güzin Bayraksan, Parinaz Naghizadeh
日本語で読む → - 論文強化学習機械学習
状態認識型探索を備えたデュアルフロー強化学習
連続制御タスクにおいて、報酬分布と方策分布をフローマッチングで同時にモデル化し、多峰性の探索を改善する新しいアクタークリティック手法を提案した。
原題: Dual-Flow Reinforcement Learning with State-Aware Exploration / Qijun Li, Zheng Fu, Qi Song 他
日本語で読む → - 論文AIアート/映像生成cs.MM
ワールドシミュレーター:クィアエロティカと世界を約束するAIビデオモデルの不条理
AIビデオモデルが「世界シミュレーター」と称する一方で、性的表現を排除している矛盾を、ゲイエロティカを入力して幻覚的な映像を生成するビデオインスタレーションで可視化し、シミュレーションの限界と身体の表象について問う作品論文。
原題: World Simulator: Queer Erotica and the Absurdity of AI Video Models That Promise the World / Adam Cole, Mick Grierson
日本語で読む →