論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/12 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文具現化AI評価ロボティクス
運用型デジタルツインクリニックによる具現化AIのタスクベース評価
日常の診療画像をシミュレータ対応のデジタルツインに変換し、具現化AIのタスク評価を可能にする手法を提案。眼科クリニックの39シーンで再構成品質やロボット動作の実現性を検証した。
原題: Operational digital twin clinics enable task-based evaluation of embodied AI / Xinyuan Wu, Jingrao Zhang, Mengdi Xu 他
日本語で読む → - 論文群制御ロボティクス
隣接行列に基づくスペクトル代理制御による移動通信エージェント
移動するタスクエージェント群に対して、通信エージェントをリアルタイムに再配置する制御手法を提案。フィードラー・ベクトルの代わりに隣接行列の主固有ベクトルを用いることで、分散推定の収束が速く、通信制約下でのロバスト性が向上することを示した。
原題: Adjacency-Based Spectral Proxy Control of Mobile Communication Agents / Mariana del Castillo, Federico Larroca
日本語で読む → - 論文VLA/プランニングAI
HUGIN: 自律物流仕分けのための視覚言語プランニングの強化
自律物流仕分けシステムにおける複数カメラ視点を統合した計画問題を新たに定義し、視覚言語モデルの性能を高める訓練フレームワークHUGINを提案。データ拡張と文脈ランキングにより精度を大幅に向上させた。
原題: HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting / Xikai Sun, Cangtian Zhou, Kebin Liu 他
日本語で読む → - 論文VLAAI
見ずして先を見通す:ワールドアクションモデルのための潜在的未来
未来のビデオを生成せずに、潜在的な未来の状態をアクション生成に活用する新しいワールドアクションモデル「ForeWAM」を提案し、LIBEROベンチマークで高い成功率を達成した。
原題: Foresight Without Seeing: Latent Futures for World Action Models / Jiakai Huang, Zhongbo Wu, Zheng Zhang 他
日本語で読む → - 論文安全オフラインRL機械学習
再分配に基づくコスト推定によるスパース安全オフライン強化学習の改善
軌道レベルの停止フィードバックのみから密なステップごとのコストを推定し、制約付きオフライン強化学習を改善するフレームワークを提案した。
原題: Redistribution-based Cost Inference Improves Sparse Safe Offline RL / Ebenezer Gelo, Geraud Nangue Tasse, Steven James 他
日本語で読む → - 論文映像表現学習画像認識
AVA-Encoder: エージェントネイティブな映像表現学習に向けて
映像生成エージェントが映画品質の映像を学習できるように、映像をフィルム知識グラフに変換して再構成する自己進化型オートエンコーダを提案し、エージェントが扱いやすい映像表現を獲得する。
原題: AVA-Encoder: Towards Agent-Native Video Representation Learning / Chuyue Li, Jinpeng Yu, Haozhe Wang 他
日本語で読む → - 論文3D物体検出画像認識
Map-Det3D: ストリーミング入力からの多視点3D物体検出のためのメトリックフィードフォワード3D再構築事前知識
単眼ビデオから直接メトリック3D空間で物体検出を行うため、RGBから3D再構築するフィードフォワードモデルを幾何学的バックボーンとして利用し、2Dから3Dへのリフティングを回避する新しいオンライン多視点3D物体検出モデルを提案した。
原題: Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs / Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò 他
日本語で読む → - 論文リハビリテーション画像認識
骨格動作予測と関節別評価による自律型遠隔リハビリテーション
RGBビデオから骨格動作を認識し、運動品質評価と短期的な動作予測を組み合わせた遠隔リハビリテーションシステムを提案。各関節の位置誤差を可視化し、セラピストなしでの自律的なフィードバックを可能にする。
原題: Autonomous Telerehabilitation via Skeletal Motion Prediction and Joint-Level Performance Assessment / Lara Pereira, João Ruivo Paulo, Pedro Santos 他
日本語で読む → - 論文世界モデル画像認識
より良いスロットはより良い世界を生む:オブジェクト中心世界モデルにおける表現品質とロバスト性
オフライン軌跡から学習する世界モデルにおいて、オブジェクト中心表現の品質が計画性能や分布シフトへのロバスト性に与える影響を、シーン中心モデルとの比較で体系的に分析した論文。
原題: Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models / Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan 他
日本語で読む → - 論文自動運転/セキュリティ機械学習
高次液体証拠符号化による自動運転向け段階的GNSSスプーフィング検出
GNSSスプーフィング攻撃を検出するため、物理に基づく残差とその高次変動を液体エンコーダで処理する因果的枠組みを提案した。実データで高いF1スコアを達成した。
原題: High-Order Liquid Evidence Encoding for Gradual GNSS Spoofing Detection in Autonomous Driving / Muhammad Ayub Sabir, Junbiao Pang, Fatima Ashraf
日本語で読む → - 論文手姿勢推定画像認識
手の可視性検出器:手の各キーポイントの可視性推定
手の各関節の可視性を推定するモデルを提案し、可視性を重み付けした三角測量により3D手姿勢アノテーションの精度を向上させた。
原題: Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands / Ryosei Hara, Masashi Hatano, Rintaro Yanagi 他
日本語で読む → - 論文教育/スマート製造制御
AI時代のスマート製造に向けた労働力準備態勢を強化する概念フレームワーク
スマート製造に必要な能力を9段階で評価する「労働力準備レベル(WRL)」フレームワークを提案し、大学の教育ラボと89件のプロジェクトで実証した論文。
原題: A Conceptual Framework for Enhancing Workforce Readiness for Smart Manufacturing in the AI Era / Dalton Ross Smith, Wilburn Whittington, Alejandro Martinez 他
日本語で読む → - 論文ナビゲーション画像認識
DreamFly: 空中視覚言語ナビゲーションのための因果メモリと後退地平線拡散プランニング
空中VLNタスクにおいて、過去の観測のみを用いた因果メモリと、Kステップの行動計画を生成し最初の行動だけを実行する後退地平線拡散プランニングを導入し、停止判定を分離することでナビゲーション性能を向上させた。
原題: DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation / Yan Deng, Fei Xu
日本語で読む → - 論文無線センシング機械学習
データギャップを埋める:AI無線センシングの新パラダイムとしてのデジタルツイン
環境の3Dデジタルツインからレイトレーシングで合成チャネル応答を生成し、逐次ニューラルネットを訓練してデバイス不要の位置推定を実現する手法を提案。
原題: Bridging the Data Gap: Digital Twin as a New Paradigm for AI-based Radio Sensing / Éloi Sainte-Beuve, Guillaume Larue, Louis-Adrien Dufrène 他
日本語で読む → - 論文手術ロボット学習ロボティクス
外科用WAM:データ効率的な手術ロボット学習のためのワールド・アクションモデル
手術ロボットの操作学習において、動作ラベル付きデモデータが不足する問題に対し、動作ラベルなしの内視鏡ビデオで事前学習する統一生成モデルを提案し、閉ループ制御で成功率を向上させた。
原題: Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning / Wenrui Bao, Tianyun Jiang, Zhiben Chen 他
日本語で読む → - 論文サイバーセキュリティcs.CR
電気自動車充電インフラにおけるサイバー攻撃検知のベンチマーク:正規ユーザー更新を考慮して
電気自動車の充電インフラにおけるサイバー攻撃検知を、正規のユーザー更新を考慮したベンチマークで評価し、新しいデュアルブランチモデルを提案した論文。
原題: Benchmarking Cyberattack Detection in Electric Vehicle Charging Infrastructure with Benign User Updates / Hannan Chen, Roshni Anna Jacob, Jie Zhang
日本語で読む → - 論文顔ランドマーク検出画像認識
統一動的顔ランドマーク検出に向けて
顔ランドマーク検出において、異なるN点データセットを統一する新しい表現とクエリベースの手法を提案し、単一モデルで任意のランドマークを予測可能にした。
原題: Towards Unified Dynamic Face Landmark Detection / Sebastian Regalado, Varshanth R. Rao, Ruowei Jiang 他
日本語で読む → - 論文ビデオ理解/質問応答画像認識
R4DSG:長尺一人称ビデオにおけるオブジェクト中心の質問応答のための相対4Dシーングラフメモリ
長い一人称ビデオから、物体の移動や状態変化などの質問に答えるため、安定したアンカーと動的物体を分離し、アンカー相対の変化として物体状態を記憶する新しいメモリ表現を提案した。
原題: R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video / Ke Ma, Yamin Mao, Weiming Li 他
日本語で読む → - 論文医用画像処理画像認識
ENCORE: 低線量CTノイズ除去のための効率的なノイズ文脈認識表現
CT画像のノイズ特性を考慮した新しいノイズ除去フレームワークを提案し、局所的なノイズパワーと相関を利用して畳み込み重みを適応的に変化させることで、画質と計算効率を向上させた。
原題: ENCORE: Efficient Noise Context-Aware Representation for Low-Dose CT Denoising / Minwoo Yu, N. Robert Bennett, Jongduk Baek 他
日本語で読む → - 論文ビデオ鑑識画像認識
VidForensics-M1: 検証可能な時間的接地を用いたメタ検出強化学習によるAI生成ビデオ鑑識
AI生成ビデオ検出のための新しいメタ検出強化学習フレームワークを提案し、時間的接地を証拠として利用することで、ラベル予測と証拠の統合を強化し、未見の生成モデルへの一般化を向上させた。
原題: VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics / Bowei Liu, Zheng Lu, Yuhan Bian 他
日本語で読む → - 論文LLMエージェント機械学習
実行可能な幻覚検出:潜在的不確実性をエージェント的批判へ変換する
LLMエージェントがユーザー指示に反した幻覚的行動を取る問題に対し、凍結したベースモデルに並行して動作する軽量LoRAアダプタ「Latent Critic」を導入し、潜在空間の不確実性信号を増幅して局所的な自然言語フィードバックに変換することで、リアルタイムで検出・修正を可能にした。
原題: Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique / Sanidhya Vijayvargiya, Rahul Lokesh
日本語で読む → - 論文3D再構成/ロボット知覚ロボティクス
SpotlessGS: 動的照明下でのロボット知覚のための再照明可能な3Dガウシアンスプラッティング
暗所でロボットの照明が不均一になる問題を解決するため、3Dガウシアンスプラッティングに照明パラメータの同時最適化、球面調和関数による低周波照明モデル、MLPベースのBRDFを導入し、再照明可能な3D再構成を実現した。
原題: SpotlessGS: Relightable 3D Gaussian Splatting under Dynamic Illumination for Robotic Perception / Liang Hong, Jiaxin Wei, Simon Schaefer 他
日本語で読む → - 論文VLA画像認識
視覚言語モデルの空間推論のための多視点関係蒸留
視覚言語モデルの空間推論能力を向上させるため、幾何学的に基盤づけられた視覚モデルから、特徴量そのものではなく視点間のパッチ類似度を蒸留する手法を提案した。
原題: Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models / Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim 他
日本語で読む → - 論文画像保護画像認識
NullEdit: VLM条件リダイレクトによるステルス画像保護
画像編集モデルによる不正な改変を防ぐため、VLMの表現をリダイレクトして編集を無効化しつつ、画像の自然さと同一性を保つ手法を提案した。
原題: NullEdit: Stealthy Image Protection via VLM Condition Redirection / Weiyao Huang, Liqin Wang, Ziqi Sheng 他
日本語で読む → - 論文変形物操作ロボティクス
変形物操作のためのTCAM:WBCD 2026トラック4におけるRMC2チャンピオンシステム
この論文は、Tシャツのピッキングから整列、平滑化までの変形物操作タスクを完全自律で行うシステムを、TCAMフレームワークを用いて構築した技術報告です。
原題: TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4 / Guangrui Shen, Zhili He, Shigang Wang 他
日本語で読む → - 論文エージェントAIAI
Combodied Agents:人間中心のエージェントAIの新パラダイム
デジタルエージェントと身体化エージェントの限界を超え、個人の状態変化をモデル化・予測・支援する人間中心のエージェントAIパラダイム「Combodied Agents」を提案する。
原題: ComBodied Agents: a New Paradigm of Human-Centric Agentic AI / Qianggang Ding, Xingyao Wang, Rui Feng 他
日本語で読む → - 論文インタラクション予測画像認識
HUI360: ロボットと人間のインタラクション予測のための360度自己中心視点データセットとベースライン
移動ロボットが収集した360度映像から、人間とロボットのインタラクションを予測するための大規模データセットHUI360を構築し、自動アノテーションパイプラインとベースラインモデルを提供した。
原題: HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation / Raphael Lorenzo-Louis, Fabio Amadio, Bertrand Luvison 他
日本語で読む → - 論文能動的知覚AI
身体化された曖昧性解消のための能動的知覚
ロボットが自然言語の指示で目標物体を特定する際、観察不足による曖昧性を能動的な視点変更で解消する枠組みを提案。視覚言語モデルを用いて観察継続・質問・選択を判断する。
原題: Active Perception for Embodied Disambiguation / Yiwei Liu, Luwei Yang
日本語で読む → - 論文3Dシーン理解画像認識
CausalSplat: 3Dガウシアンスプラッティングにおける包括的階層的推論に向けて
3Dガウシアンスプラッティングを用いたシーン理解において、暗黙的な意図や常識推論を扱う新しいタスクを提案し、ベンチマークとフレームワークCausalSplatを構築した。
原題: CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting / Jiayu Ding, Meilu Song, Yun Chen 他
日本語で読む → - 論文エージェントアーキテクチャAI
CEAA: インタラクティブコンピューティングシステムのための認知的身体化エージェントアーキテクチャ
本論文は、Sense-Think-ActパラダイムとBelief-Desire-Intentionモデルを基盤とした、モジュール式の認知アーキテクチャを提案し、インタラクティブな3D仮想環境で動作する身体化された知的仮想エージェントの実装を容易にすることを目指している。
原題: CEAA: A Cognitive Embodied Agents Architecture for Interactive Computing Systems / Aimilios Hadjiliasi, Louis Nisiotis
日本語で読む →