論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/13 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文画像偽造検出画像認識
Venus-DeFakerOne: 統合型偽造画像検出・位置特定
生成AIの進化に伴い多様化する画像偽造に対し、既存の検出手法は領域ごとに分断されている。本論文では、InternVL2とSAM2を統合した統一基盤モデルDeFakerOneを提案し、画像レベルの検出と画素レベルの位置特定を同時に実現する。
原題: Venus-DeFakerOne: Unified Fake Image Detection & Localization / GuangJian Team
日本語で読む → - 論文3D生成cs.GR
Rigel3D: アニメーション対応3Dアセット生成のためのリグ認識潜在表現
リグ付きメッシュとしてアニメーション可能な3Dアセットを生成する手法を提案。形状とリグ構造を同時にモデル化し、骨格とスキニング重みを生成する。
原題: Rigel3D: Rig-aware Latents for Animation-Ready 3D Asset Generation / Nikitas Chatzis, Marios Loizou, Evangelos Kalogerakis
日本語で読む → - 論文神経計算cs.ET
具現化神経計算:生物学的神経培養とスケール化タスク駆動検証を接続するフレームワーク
生物学的ニューラルネットワーク(BNN)を用いた閉ループナビゲーションタスクにおいて、約1300のパラメータ組み合わせを評価し、学習可能な構成を特定。シリコンベースのDQNエージェントより高い性能を示した。
原題: Embodied Neurocomputation: A Framework for Interfacing Biological Neural Cultures with Scaled Task-Driven Validation / Johnson Zhou, Daniel Tanneberg, Forough Habibollahi 他
日本語で読む → - 論文顔提示攻撃検出画像認識
フロー拡張と知識蒸留による軽量な顔提示攻撃検出
顔提示攻撃検出のための軽量モデルを、オプティカルフローを教師モデルで活用し、知識蒸留でRGBのみの生徒モデルに運動情報を転移することで、推論時の計算コストを抑えつつ高精度を実現した。
原題: Flow Augmentation and Knowledge Distillation for Lightweight Face Presentation Attack Detection / Muhammad Shahid Jabbar, Muhammad Sohail Ibrahim, Taha Hasan Masood Siddique 他
日本語で読む → - 論文推論AI
大規模学習モデルにおける強化された効率的推論
大規模言語モデルの推論を効率的に改善するため、データをUnary Relational Integracodeに再コード化する前処理と、その後の機械学習を組み合わせた手法を提案する。
原題: Enhanced and Efficient Reasoning in Large Learning Models / Leslie G. Valiant
日本語で読む → - 論文解釈可能性機械学習
トランスフォーマーは高度に構造化された世界モデルを線形に表現する
数独の解法トレースで訓練したトランスフォーマーの内部表現を解析し、セル単位ではなく行・列・ボックス単位で世界モデルを構築し、最終MLP層に特定セルの候補が1つに絞られたことを検出する専用ニューロン群(裸のシングル回路)が存在することを発見した。
原題: Transformers Linearly Represent Highly Structured World Models / Roman Kniazev, Nathanaël Fijalkow
日本語で読む → - 論文シーン生成画像認識
HetScene: 不均一性を考慮した拡散モデルによる高密度屋内シーン生成
屋内シーン生成において、物体を主要物体と副次物体に分解し、構造レイアウト生成と文脈レイアウト生成の2段階で生成する不均一性対応フレームワークを提案した。
原題: HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation / Zini Chen, Junming Huang, Rong Zhang 他
日本語で読む → - 論文動作再構築画像認識
EgoForce: 拡散フォーシングによる頑健なオンライン自己中心視点動作再構築
自己中心視点の映像から全身動作をオンラインで再構築する手法を提案。拡散フォーシングに基づく時間的非対称ノイズスケジュールで、ストリーミング入力に応じて逐次的にノイズを除去し、頑健かつリアルタイムな動作推定を実現。
原題: EgoForce: Robust Online Egocentric Motion Reconstruction via Diffusion Forcing / Inwoo Hwang, Donggeun Lim, Hojun Jang 他
日本語で読む → - 論文計画/ベンチマークAI
Ego2World: 一人称調理動画を実行可能な世界へ変換し信念状態計画を行う
一人称調理動画から実行可能なシンボリック世界を構築し、部分観測下での信念状態計画を評価するベンチマークを提案した論文。
原題: Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning / Qinchuan Cheng, Zhantao Gong, Pengzhan Sun 他
日本語で読む → - 論文3D生成画像認識
GTA: 幾何学から外観へのビデオ拡散による画像から3Dワールド生成の高度化
単一画像から3Dシーンを生成する際、まず粗い幾何構造を生成し、その後に外観を生成する二段階のビデオ拡散モデルを提案し、構造の忠実性と視点間の一貫性を向上させた。
原題: GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion / Hanxin Zhu, Cong Wang, Peiyan Tu 他
日本語で読む → - 論文マルチエージェント強化学習制御
部分モジュラーマルチエージェントポリシー学習によるオープンマルチエージェントシステムにおけるオンライン分散タスク割り当て
本論文は、部分モジュラーなチーム効用を持つマルチエージェント強化学習を用いて、オンライン分散タスク割り当て問題を解決する。カテゴリカルポリシーと整合する新しい連続緩和法(PME)を導入し、SubMAPGという集中学習・分散実行のポリシー勾配法を提案する。
原題: Submodular Multi-Agent Policy Learning for Online Distributed Task Allocation in Open Multi-Agent Systems / Jing Liu, Yangyang Yang, Luca Ballotta 他
日本語で読む → - 論文ワールドモデル機械学習
拡散ワールドモデルのための記憶専門家の構成
拡散ベースのワールドモデルにおいて、短期・長期・空間記憶の専門家を対照的な専門家積で統合し、過去の観測との整合性を保ちつつ長いコンテキストを効率的に扱う手法を提案した。
原題: Composition of Memory Experts for Diffusion World Models / Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan 他
日本語で読む → - 論文ビデオ生成/身体性転写画像認識
OmniHumanoid: ペアデータ不要の適応によるストリーミング型クロス身体性ビデオ生成
異なる身体性(人間やロボット)間で動作を転写するビデオ生成フレームワークを提案。共有動作モデルと軽量な身体性アダプタにより、ペアデータなしで新しいロボットへの適応を可能にした。
原題: OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation / Yiren Song, Xiyao Deng, Pei Yang 他
日本語で読む → - 論文世界モデルAI
エンタープライズシステムに学習された世界モデルは必要か?動態推論における文脈の重要性
設定可能で読み取り可能な遷移動態を持つエンタープライズ環境では、オフライン学習された世界モデルは分布シフトに弱いが、実行時に設定を読む発見型エージェントは堅牢であることを示した。
原題: Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics / Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary 他
日本語で読む → - 論文意思決定機械学習
PriorZero: 言語事前知識と世界モデルを橋渡しする意思決定フレームワーク
大規模言語モデルの事前知識を世界モデルベースの計画に統合し、探索と学習の安定性を両立する新しいフレームワークPriorZeroを提案した。
原題: PriorZero: Bridging Language Priors and World Models for Decision Making / Junyu Xiong, Yuan Pu, Jia Tang 他
日本語で読む → - 論文理論/認知科学AI
同じ観察から結論が分かれる理由:推論による世界モデルの非識別性の形式化
同じデータや観察を共有しても結論が分かれる現象を、相手の欠陥ではなく推論・学習に内在する非識別性として形式化し、そのメカニズムを理論的に整理した論文。
原題: Why Conclusions Diverge from the Same Observations: Formalizing World-Model Non-Identifiability via an Inference / Toru Takahashi
日本語で読む → - 論文深度推定画像認識
焦点可能な単眼深度推定
指定された対象領域に焦点を当てて深度推定を行う新しいタスクと、プロンプト条件付きのフレームワークを提案した論文。
原題: Focusable Monocular Depth Estimation / Yuxin Du, Tao Lin, Zile Zhong 他
日本語で読む → - 論文世界モデル/ナビゲーション画像認識
3D-Belief:生成的3D世界モデリングによる身体化された信念推論
部分観測から3D空間でのエージェントの信念を推定・更新する生成的3D世界モデルを提案し、シミュレーションと実世界の物体ナビゲーションタスクで有効性を示した。
原題: 3D-Belief: Embodied Belief Inference via Generative 3D World Modeling / Yifan Yin, Zehao Wen, Suyu Ye 他
日本語で読む → - 論文3D点群セグメンテーション画像認識
PointGS: 3Dガウススプラッティングを用いた意味的に一貫した教師なし3D点群セグメンテーション
3Dガウススプラッティングを中間表現として用い、2DのSAMセグメンテーション結果を3D点群に蒸留することで、教師なしで意味的に一貫した点群セグメンテーションを実現する手法を提案した。
原題: PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting / Yixiao Song, Qingyong Li, Wen Wang 他
日本語で読む → - 論文強化学習機械学習
最適Qガイダンスによるフローマップポリシーの整合
拡散やフローマッチングに基づく生成ポリシーの推論コストを削減するため、任意のジャンプ(1ステップを含む)を学習するフローマップポリシーを提案し、オフラインからオンラインへの強化学習において、批評家のQ値に基づく信頼領域最適化で適応させる手法を導入した。
原題: Aligning Flow Map Policies with Optimal Q-Guidance / Christos Ziakas, Alessandra Russo, Avishek Joey Bose
日本語で読む → - 論文世界モデル機械学習
PROWL: 世界モデル学習のための優先度付き後悔駆動最適化
拡散ベースの世界モデルに対し、敵対的カリキュラムと優先度付きバッファを用いて、稀な高影響遷移でのロバスト性を向上させる手法を提案した。
原題: PROWL: Prioritized Regret-Driven Optimization for World Model Learning / Ahmet H. Güzel, Jenny Seidenschwarz, Benjamin Graham 他
日本語で読む → - 論文ビデオ生成/物理推論画像認識
PhyGround: 生成ワールドモデルにおける物理推論のベンチマーク
ビデオ生成モデルの物理法則遵守を評価するための、基準に基づいたベンチマークと自動評価器を提案した論文。
原題: PhyGround: Benchmarking Physical Reasoning in Generative World Models / Juyi Lin, Arash Akbari, Yumei He 他
日本語で読む → - 論文VLMナビゲーション画像認識
SleepWalk:指示付き視覚言語ナビゲーションのストレステストのための3層ベンチマーク
テキストから生成された3D環境で、指示に基づく軌道予測を評価するベンチマークを提案し、最先端のVLMが空間推論に系統的な失敗をすることを示した。
原題: SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation / Niyati Rawal, Sushant Ravva, Shah Alam Abir 他
日本語で読む → - 論文ビデオ理解画像認識
EgoMemReason: 長時間の自己中心視点映像理解のための記憶駆動型推論ベンチマーク
数日間にわたる自己中心視点映像の理解を評価する新しいベンチマークを提案し、エンティティ記憶、イベント記憶、行動記憶の3種類の記憶に基づく推論をテストする。
原題: EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding / Ziyang Wang, Yue Zhang, Shoubin Yu 他
日本語で読む → - 論文世界モデル機械学習
Sub-JEPA: 部分空間ガウス正則化による安定なエンドツーエンド世界モデル
JEPA世界モデルの学習崩壊を防ぐため、埋め込み空間全体ではなく複数のランダム部分空間にガウス事前分布を課す手法を提案し、連続制御タスクで既存手法を大きく上回る性能を示した。
原題: Sub-JEPA: Subspace Gaussian Regularization for Stable End-to-End World Models / Kai Zhao, Dongliang Nie, Yuchen Lin 他
日本語で読む → - 論文視覚推論画像認識
マルチモーダルモデルは電気羊を想像するのか?
空間パズルを解く際に大規模マルチモーダルモデルが心的イメージを形成することを発見し、そのイメージを利用して推論性能を向上させる手法を提案した論文。
原題: Do multimodal models imagine electric sheep? / Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes 他
日本語で読む → - 論文マルチモーダル学習機械学習
FLAME: 継続的マルチモーダル・マルチタスク学習のための適応型Mixture-of-Experts
マルチモーダルタスクの事前学習と継続学習を両立するスケーラブルなMoEフレームワークを提案し、医療ベンチマークで有効性を検証した。
原題: FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning / Xing Han, Shravan Chaudhari, Tanvi Ranade 他
日本語で読む → - 論文強化学習/セキュリティ機械学習
Plan2Cleanse: モンテカルロ計画による深層強化学習のテスト時バックドア防御
強化学習モデルに埋め込まれたバックドア攻撃を、再学習なしでテスト時に検出・無害化するフレームワークを提案。モンテカルロ木探索を計画問題として適用し、ブラックボックスでトリガー探索と防御的再計画を行う。
原題: Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning / Sze-Ann Chen, Zhi-Yi Chin, Kui-Yuan Chen 他
日本語で読む → - 論文軌道異常検知cs.DC
軌道異常検知のための多層ラベリングと物理情報学習の大規模適用
軌道異常の大規模ラベリングを実現するため、物理ルール、IMM-UKFフィルタ、補助要素校正の3段階の弱教師ありカスケードを構築し、Transformerモデルを学習して高再現率のトリアージ分類器を実現した。
原題: Multi-Tier Labeling and Physics-Informed Learning for Orbital Anomaly Detection at Scale / Yong Fu
日本語で読む → - 論文エージェント学習AI
ワークスペース最適化:エージェントの訓練方法
フロンティア言語モデルベースのエージェントの重みは変えられないため、代わりにエージェントが読み書きする外部基盤(ワークスペース)を進化させる手法を提案し、ARC-AGI-3で性能向上を実証した。
原題: Workspace Optimization: How to Train Your Agent / Elad Sarafian, Gal Kaplun, Ron Banner 他
日本語で読む →