論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/27 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/量子化画像認識
HoloQ-VLA: 視覚言語行動モデルの一様W4A4量子化
視覚言語行動モデルを、拡散アクションヘッドを含む全体を一様に4ビット量子化する訓練不要のフレームワークを提案し、性能を維持しつつメモリを大幅削減した。
原題: HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models / Xinyu Wang, Mingze Li, Sicheng Lyu 他
日本語で読む → - 論文敵対的攻撃/フォレンジックVLM画像認識
JECA^2: フォレンジック視覚言語モデルに対する判断と説明が一致した敵対的攻撃
画像改ざん検出と説明生成を行うフォレンジックVLMに対し、判断結果と説明文が矛盾しないように攻撃する手法JECA^2を提案した。視覚的にはGrad-CAM誘導で注目領域を改ざん箇所から正常領域へずらし、テキスト的にはプロンプト埋め込みを最適化して説明を偽の判断に合わせる。
原題: JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models / Jiachen Qian
日本語で読む → - 論文マルチエージェント強化学習AI
微分可能な信念に基づく対戦相手形成
対戦相手の信念を状態として捉え、その信念更新を微分可能な形でモデル化することで、報酬構造から最適な戦略を自動的に学習する新しい対戦相手形成手法を提案した。
原題: Differentiable Belief-based Opponent Shaping / Aarav G Sane, Karthik Sivachandran, Rohan Paleja
日本語で読む → - 論文安全性/VLM画像認識
画像思考と安全性の交差点:マルチモーダル脱獄耐性を決めるものは何か?
大規模視覚言語モデルにおける画像ツールの明示的利用が脱獄攻撃成功率を約30%低下させることを発見し、そのメカニズムを表現ベクトルの安全性方向へのシフトとして説明した論文。
原題: When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness? / Yuan Tian, Bing Hu, Fang Wu 他
日本語で読む → - 論文空間推論AI
空間複雑性の分解:LLMの空間推論のための階層的分解
LLMの空間推論能力を向上させるため、複雑なタスクを階層的に分解する手法と、MCTS誘導のグループ相対方策最適化(M-GRPO)を提案し、ナビゲーションや計画などの空間タスクで最先端の性能を達成した。
原題: Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning / Yi Wang, Haojie Lu, Zhaofan Zhang 他
日本語で読む → - 論文VLA画像認識
GEM: 生成的監視が身体化知能を強化する
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
原題: GEM: Generative Supervision Helps Embodied Intelligence / Ruowen Zhao, Bangguo Li, Zuyan Liu 他
日本語で読む → - 論文推薦システム機械学習
感情音楽推薦:オフライン選好最適化のためのロールアウトベース世界モデル
臨床ユーザーを含む感情状態を目的とする音楽推薦システムAMRSを提案し、ロールアウトベースの世界モデルでオフライン学習とストレステストを行い、DPOで選好最適化する手法を実証した。
原題: Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization / Audrey Chan, Aaron Labbé, Jacob Lavoie 他
日本語で読む → - 論文物理シミュレーション機械学習
ハイブリッド神経世界モデル
物理シミュレーションの高速化のため、ニューラルサロゲートと古典的ソルバーを組み合わせ、不確実な軌道を検出してフォールバックする手法を提案した。
原題: Hybrid Neural World Models / Pranav Lakshmanan, Paras Chopra
日本語で読む → - 論文最適化/宇宙デブリ捕獲機械学習
グラフ学習支援型混合組合せ最適化による能動テザーネットシステムの設計:宇宙デブリ捕獲への応用
宇宙デブリ捕獲用の能動テザーネットシステムの設計と制御を、グラフニューラルネットワークを用いた新しい最適化手法で同時に探索する論文。
原題: Designing Active Tether-Net Systems for Space Debris Capture with Graph-Learning-Aided Mixed-Combinatorial Optimization / Feng Liu, Achira Boonrath, Gishnu Madhu 他
日本語で読む → - 論文VLA/攻撃/転移性画像認識
VLA-Hijack: 視覚的プロプリオセプション乗っ取りによる視覚言語行動モデルへの転移可能なパッチ攻撃
VLAモデルが動作計画前にロボットアームの自己位置を視覚で特定する共通の脆弱性を突き、注意誘導型プロプリオセプション抑制とマルチモーダル注入によりパッチを偽の身体として埋め込む転移可能な攻撃手法を提案した。
原題: VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking / Jiyuan Fu, Kaixun Jiang, Jingkai Jia 他
日本語で読む → - 論文ビデオ生成画像認識
CogPortrait: 階層的エージェント計画による肖像アニメーションの微細な眼部制御
高レベルなラベルから眼部の微細な動きを制御する肖像アニメーション生成フレームワークを提案。MLLMエージェントによるキーポイント計画とDiTベースのビデオ生成を組み合わせ、思考や眠気などの感情を超えた状態も表現可能。
原題: CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning / He Feng, Yongjia Ma, Donglin Di 他
日本語で読む → - 論文細胞モデル機械学習
Chreode: ワンステップ時間ダイナミクスと摂動予測のための細胞世界モデル
細胞の転写状態変化をワンステップで予測する新しい世界モデルを提案し、発生軌跡の事前学習が摂動予測の精度を向上させることを示した。
原題: Chreode: A Cell World Model for One-Step Temporal Dynamics and Perturbation Prediction / Mufan Qiu, Genhui Zheng, Yinuo Xu 他
日本語で読む → - 論文シミュレーションcs.GR
ClothTransformer: 統一潜在空間トランスフォーマーによるスケーラブルな布地シミュレーション
布地シミュレーションを学習された潜在空間での自己回帰シーケンスモデリングとして再定式化し、多様なシナリオを単一モデルで扱える統一トランスフォーマーを提案。従来手法より誤差を約4〜9倍低減し、メッシュ解像度に依存しないスケーラブルな計算を実現した。
原題: ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation / Yu Zhang, Yidi Shao, Wenqi Ouyang 他
日本語で読む → - 論文強化学習機械学習
LLM報酬設計が失敗するとき:スパース構造化RLのための診断駆動型改良
スパースで構造化された強化学習タスクにおいて、LLMによる報酬整形を一回生成ではなくデバッグとして捉え、訓練診断と失敗モード分類に基づく反復改良を提案し、DoorKey-8x8やKeyCorridorの成功率を大幅に向上させた。
原題: When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL / Youting Wang, Yuan Tang, Bowen Liu 他
日本語で読む → - 論文世界モデル画像認識
Gamma-World: 2人を超える生成型マルチエージェント世界モデル
複数エージェントが同時に動作する環境向けの生成型世界モデルを提案し、エージェントの対称性を保つ符号化と効率的な注意機構により、リアルタイムなインタラクティブシミュレーションを実現した。
原題: Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players / Fangfu Liu, Kai He, Tianchang Shen 他
日本語で読む → - 論文マルチモーダル検出画像認識
REVEAL: 参照に基づく推論によるマルチモーダル操作検出
画像とテキストのペアの偽造を検出し、改ざん領域を特定するために、検索した真正な証拠と比較する参照基盤の検証フレームワークを提案した。
原題: REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection / Jun Zhou, Bingwen Hu, Yaxiong Wang 他
日本語で読む → - 論文物理シミュレーション/材料設計機械学習
LEIA: インタラクティブなアーキテクチャ材料のための学習環境
実材料の非線形力学を学習し、境界条件を段階的に与えると変形・応力場をリアルタイムに予測するワールドモデルを提案。3次元メッシュを扱い、材料設計の高速探索にも応用できる。
原題: LEIA: Learned Environment for Interactive Architected Materials / Haiqian Yang, Yuan Cao, Markus J. Buehler
日本語で読む → - 論文検証制御
制御とニューラルネットワーク検証器α,β-CROWNを橋渡しする:チュートリアル
本論文は、制御系の安全性や安定性を形式的に検証するために、ニューラルネットワーク検証器α,β-CROWNを活用する統一フレームワークを解説するチュートリアルである。
原題: Bridging Control with Neural Network Verifier alpha-beta-CROWN: A Tutorial / Haoyu Li, Xiangru Zhong, Hao Cheng 他
日本語で読む → - 論文画像検出画像認識
目がAIを裏切るとき:社会的視線の一貫性を意味的手がかりとしたAI生成画像検出
生成画像の検出に、人物間の視線方向や頭と目の向き、瞳孔位置の相互一貫性という高次意味的手がかりを導入し、既存の低レベル特徴とは独立した検出軸を提案した。
原題: When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection / Jihyeon Kim, Sohee Kim, Soosan Lee 他
日本語で読む → - 論文エージェントAI/安全性AI
管理された自律性としての知能:エージェント型AIシステムにおける失敗、エスカレーション、ガバナンス
エージェント型AIの自律性が高まる中、不確実性が増した際に動作を継続する「無制限な自律性」の脆弱性を指摘し、エピステミックな逸脱を検出して推論を中断・回復・制御委譲する「管理された自律性」理論を提案。SMARtモデルという4層フレームワークをペトリネットで形式化し、安全性とガバナンス到達可能性を理論的に保証する。
原題: Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems / Srini Ramaswamy
日本語で読む → - 論文模倣学習/蒸留機械学習
表現力豊かな教師からの敵対的二重オン方策蒸留
デモのみから学習する強化学習において、フローマッチング教師とMLP生徒を敵対的に共訓練し、報酬と行動の二つの蒸留信号でオンライン探索と局所学習を両立させる手法FA-OPDを提案。
原題: Adversarial Dual On-Policy Distillation from Expressive Teacher / Zhenglin Wan, Jingxuan Wu, Xingrui Yu 他
日本語で読む → - 論文ベンチマーク画像認識
SpatialBench:あなたの空間基盤モデルは万能選手か?
空間基盤モデルの真の汎化能力を評価するため、多様な領域・タスク・入力密度をカバーする大規模ベンチマークSpatialBenchを構築し、41モデルを体系的に評価した。
原題: SpatialBench: Is Your Spatial Foundation Model an All-Round Player? / Haosong Peng, Hao Li, Jiaqi Chen 他
日本語で読む → - 論文システム/継続学習制御
Orion: オンデバイスオンライン継続学習のための自己適応型メモリ管理
リソース制約のあるデバイス上でのオンライン継続学習(OCL)の実用的展開を可能にするため、メモリ圧力とワークロードの変化に応じてメモリ割り当てを動的に調整するフレームワークOrionを提案した。
原題: Orion: Enabling Self-adaptive Memory Management for On-device Online Continual Learning / Zexin Li, Nikil Dutt, Cong Liu
日本語で読む → - 論文環境影響評価q-bio.OT
BIRDS: 大規模言語モデルサービスの生物多様性影響の特徴づけと理解
LLMサービスの環境影響を炭素や水だけでなく生物多様性の観点から評価するフレームワークBIRDSを提案し、リクエスト単位の影響と品質を考慮した指標QNBIを導入した。
原題: BIRDS: Characterizing and Understanding Biodiversity Impact of Large Language Model Serving / Tianyao Shi, Yi Ding
日本語で読む → - 論文プランニングAI
言語からの潜在目標予測によるモデルベースプランニング
言語指示から中間目標状態の系列を予測し、同じ潜在空間で行動条件付きロールアウトを行うことで、長期的なプランニングを可能にするフレームワークLAGOを提案した。
原題: Latent Goal Prediction from Language for Model-Based Planning / Samuel Barbeau, Simon Roy, Giovanni Beltrame 他
日本語で読む → - 論文逆強化学習機械学習
確率的リカレント意図切替モデル
逆強化学習において、エピソード内の目標切替を捉えるため、リカレントネットワークで観測履歴から意図分布を推定する新しいモデルを提案し、EMアルゴリズムが閉形式で解けることを示した。ロボット操作データを含む複数環境で評価し、高い尤度と解釈可能な意図抽出を実現した。
原題: Probabilistic Recurrent Intention Switching Model / Wenyuan Sheng, Hao Zhu, Joschka Boedecker
日本語で読む → - 論文セグメンテーション/アフォーダンス/VLM画像認識
セグメンテーションモデルは世界を理解できるか?視覚的思考連鎖によるプロアクティブなアフォーダンス推論に向けて
セグメンテーションモデルに視覚的思考連鎖を導入し、指示の前にシーンを能動的に観察して推論することで、意図レベルの指示からアフォーダンスを持つ物体部位のセグメンテーションを可能にする新しいフレームワークSegWorldを提案した。
原題: Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought / Yuchen Guo, Junli Gong, Hongmin Cai 他
日本語で読む → - 論文3Dセグメンテーション画像認識
TrackRef3D: 3Dガウススプラッティングにおけるオープンワールド参照セグメンテーションのための多視点一貫トラック・アンド・ラベル手法
3Dガウススプラッティングにおいて、手動アノテーションなしで自然言語によるオブジェクトセグメンテーションを実現する自動パイプラインを提案。物体発見と意味的接地を分離し、軌跡認識型セマンティックコンセンサスモジュールで多視点一貫性を確保する。
原題: TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting / Yuyang Tan, Renhe Zhang, Hang Zhang 他
日本語で読む → - 論文生成モデル/アライメント機械学習
サンプルベース変分推論の償却による少数ステップ生成モデルのアライメント
生成器と参照分布へのサンプルアクセスのみで少数ステップ生成モデルを整列させる一般的な枠組みFAVを提案し、ロボット操作のポリシー整列と画像生成器の整列で有効性を示した。
原題: Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference / Jaewoo Lee, Hyeongyu Kang, Dohyun Kim 他
日本語で読む → - 論文世界モデル画像認識
What-If World: 身体性シナリオにおける汎用世界モデルのための因果ベンチマーク
ビデオ生成モデルが物理的介入に正しく反応するかを評価するため、1つの物理変数だけが異なるプロンプトペアを用いたベンチマーク「What-If World」を提案し、9つの最先端モデルが低スコアであることを示した。
原題: What-If World: A Causal Benchmark for General World Models in Embodied Scenarios / Kunlin Cai, Rui Song, Jinghuai Zhang 他
日本語で読む →