論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/29 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文行動認識画像認識
Ego-METAS: 自己中心視点のオンライン・マルチモーダル・省エネルギー時系列行動分割ベンチマーク
身体化エージェントのための、エネルギー予算を考慮したオンライン時系列行動分割の初のベンチマークを提案し、複数モダリティの動的センサ選択の重要性を示した。
原題: Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark / Maria Santos-Villafranca, Jesus Bermudez-cameo, Alejandro Perez-Yus 他
日本語で読む → - 論文テンソル操作機械学習
グラフィカルeinops:テンソルネットワークと計算グラフの橋渡し
einopsのテンソル操作を形式的な図的計算体系として表現し、軸の操作を視覚的に証明可能にする手法を提案した論文。
原題: Graphical einops: bridging tensor networks and computation graphs / Vincent Wang-Maścianica, Nikhil Khatri
日本語で読む → - 論文世界モデル機械学習
部分空間分解JEPA:潜在世界モデルにおける進行と内容の分離
JEPAの潜在表現を進行用と内容用の直交部分空間に分割し、制御性能と驚きの検出を向上させた。
原題: Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models / Lucas Thil, Jesse Read, Rim Kaddah 他
日本語で読む → - 論文ベンチマークcs.SE
BlueFin: 財務スプレッドシートにおけるLLMエージェントのベンチマーク
財務専門家向けのスプレッドシート操作タスクを集めたベンチマークBlueFinを提案し、最先端LLMの性能が低いことを示した。
原題: BlueFin: Benchmarking LLM Agents on Financial Spreadsheets / Srivatsa Kundurthy, Clara Na, Colton Moraine 他
日本語で読む → - 論文制御理論制御
期待値最大化としての一般化モデル予測経路積分制御
MPPI制御を確率的最適制御の推論問題に対するEMアルゴリズムの特殊ケースとして解釈し、ガウス分布以外にも拡張した一般化フレームワークを提案し、収束性を解析した。
原題: Generalized Model Predictive Path Integral Control as Expectation--Maximization / Jiarui Wang, Sina Sharifi, Mahyar Fazlyab
日本語で読む → - 論文ベンチマーク/地理的位置特定画像認識
ERGeoBench:マルチモーダル大規模言語モデルにおける身体化推論と地理的位置特定のための包括的ベンチマーク
身体化された地理的位置特定能力を評価する新しいベンチマークERGeoBenchを提案し、現在のMLLMが高レベルの地理的意味は推論できるが、細かい知覚や空間的一貫性に課題があることを示した。
原題: ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models / Kaiwen Xue, Tao Wei, Guoxin Zhang 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
他者の夢を見る:マルチエージェント強化学習における世界モデル内の潜在チームメイトモデリング
協調型マルチエージェント強化学習において、チームメイトの内部方策や意図を世界モデル内で潜在変数としてモデル化し、心の理論ヘッドで推論することで、多様な協調相手への適応を可能にするアーキテクチャを提案した。
原題: Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning / Tomas Leroy-Stone
日本語で読む → - 論文強化学習機械学習
生存強化学習:スケーラブルな自己教師ありRLに向けて
自己教師ありの対比強化学習の限界を克服するため、目標状態での滞在時間を最大化する分類ベースの生存価値学習フレームワークを提案し、長期的な移動タスクで既存手法を2〜8倍上回る性能を達成した。
原題: Survival Reinforcement Learning: Toward Scalable Self-Supervised RL / Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard 他
日本語で読む → - 論文VLAAI
視覚言語行動モデルにおける閉ループ神経活性制御
視覚言語行動モデルのテスト時介入を固定係数から適応的な閉ループ制御に変え、タスク成功率と概念制御の安定性を向上させる手法を提案した。
原題: Closed-Loop Neural Activation Control in Vision-Language-Action Models / Abhijith Babu, Ramneet Kaur, Nathaniel D. Bastian 他
日本語で読む → - 論文画像生成画像認識
GenClaw: コード駆動型エージェントによる画像生成
LLMエージェントがコード(SVG等)で下書きを描き、画像生成モデルで仕上げる、人間の画家のような段階的・制御可能な画像生成手法を提案した論文。
原題: GenClaw: Code-Driven Agentic Image Generation / Junyan Ye, Jun He, Zilong Huang 他
日本語で読む → - 論文VLAモデル解析AI
VLA-Trace: 表現と行動のトレーシングによる視覚-言語-行動モデルの診断
VLAモデルがマルチモーダル知識を身体制御に変換する過程を、表現ダイナミクスから因果帰属、行動発現まで段階的に診断するフレームワークを提案し、π0.5とOpenVLAの比較分析からモデル間の適応戦略や制御経路の違いを明らかにした。
原題: VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing / Haoyuan Shi, Xiancong Ren, Yingji Zhang 他
日本語で読む → - 論文3D再構成画像認識
基礎特徴量の幾何誘導モデリングによる一般化可能な物体形状変形学習
単眼画像から3D物体形状を復元するため、カテゴリレベルのテンプレートを変形させる枠組みを提案し、基礎特徴量にテンプレートのトポロジーを組み込む幾何誘導機構と視点適応型特徴集約により、未知カテゴリや多視点への頑健な一般化を実現した。
原題: Geometry-Guided Modeling of Foundation Features Enables Generalizable Object Shape Deformation Learning / Yiyao Ma, Kai Chen, Zhongxiang Zhou 他
日本語で読む → - 論文深層学習/正則化機械学習
隠れ表現の摂動学習による汎化可能な深層学習
深層ネットワークの中間活性化に対する摂動を統一的に解析し、クラスごとの摂動を学習する手法LPAを提案。バランス分類やロングテール分類、ドメイン汎化で既存手法を上回る性能を示した。
原題: Learning to Perturb Hidden Representations for Generalizable Deep Learning / Hua Li
日本語で読む → - 論文LLMエージェント/セキュリティcs.CR
無害に見えて有害:エージェントスキルにおけるステルスな幻覚誘導のためのニュートラルプロンプト攻撃
LLM駆動のコーディングエージェントが幻覚で存在しないパッケージ名を生成する際、攻撃者がその名前を登録して悪用するサプライチェーンリスクを新たに提案し、無害な指示文が幻覚を増加させる攻撃手法を実証した論文。
原題: Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills / Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang 他
日本語で読む → - 論文動作生成画像認識
Dex2HOI: 器用な両手による二物体インタラクション生成
両手で複数の物体を同時に操作する人間の動作を、テキストから生成する拡散モデルを提案した論文。
原題: Dex2HOI: Dexterous Bimanual Two-Object Interaction Generation / Chrysa Pratikaki, Pablo Ruiz-Ponce, Jiankang Deng 他
日本語で読む → - 論文状態追跡機械学習
チェスワールドモデル:チェスの手順からの正確な状態追跡のための1000万ゲームベンチマーク
実際のチェスの手順から到達する盤面状態を正確に予測する大規模ベンチマークを構築し、Transformerとリカレントモデルの状態追跡能力を比較した。
原題: Chess-World-Model: A 10M-Game Benchmark for Exact State Tracking from Chess Move Sequences / Benjamin Walker, Terry Lyons
日本語で読む → - 論文群制御制御
マルチロボットネットワークにおける創発的非エルミートトポロジー
非相反な相互作用をプログラム可能なマルチロボットネットワークを構築し、合成格子上でトポロジカルゼロモードや非エルミート皮膚効果を実験的に実証した。
原題: Emergent Non-Hermitian Topology in Multi-Robot Network / Jielong Zhang, Guiju Duan, Tinggui Chen 他
日本語で読む → - 論文VLA画像認識
逆動力学学習による視覚言語行動モデルの状態エイリアシング緩和
視覚言語行動モデルにおいて、視覚的に類似した状態が異なる行動を必要とする問題(状態エイリアシング)を、逆動力学学習を補助目的として導入することで緩和する手法を提案した。
原題: Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning / Kyujin Lee, Injae Kim, Jihwan Park 他
日本語で読む → - 論文サーベイ機械学習
ワールドモデル:アーキテクチャ、方法論、推論パラダイム、応用に関する包括的サーベイ
環境の構造とダイナミクスを学習する内部シミュレータであるワールドモデルについて、アーキテクチャ、方法論、推論戦略、応用領域の4軸で分類する包括的なサーベイを提供する。
原題: World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications / Arif Hassan Zidan, Yi Pan, Hanqi Jiang 他
日本語で読む → - 論文コンパイラ最適化AI
PassNet: グラフコンパイラパス生成のための大規模言語モデルのスケーリング
本論文は、LLMを用いてコンパイラのパス(グラフ変換)を自動生成するPassNetを提案し、長尾ワークロードでの性能向上を目指す。大規模データセットとベンチマークを構築し、既存手法より最大3倍の高速化を達成する一方、一貫性の課題を明らかにした。
原題: PassNet: Scaling Large Language Models for Graph Compiler Pass Generation / Yiqun Liu, Yingsheng Wu, Ruqi Yang 他
日本語で読む → - 論文VLA画像認識
VisualThink-VLA: 視覚的推論による効率的で低遅延な視覚言語行動ポリシー
テキストの思考連鎖に代わる視覚的推論を導入し、行動予測の精度を保ちつつ推論遅延を大幅に削減したVLAポリシーを提案。
原題: VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies / Mingjian Gao, Wenqiao Zhang, Yuqian Yuan 他
日本語で読む → - 論文形状再構成画像認識
ParCo-SDF: 変形物体の事前知識なし部分から完全への符号付き距離場学習
点群観測から変形物体の完全な形状を再構成するため、時間的幾何エンコーディングとFiLM条件付きSDF予測からなる2段階フレームワークを提案した。物体固有の形状事前知識を必要とせず、重度のオクルージョン下でも高忠実な再構成を実現する。
原題: ParCo-SDF: Learning Prior-Free Partial-to-Complete Signed Distance Fields of Deformable Objects / Deokmin Hwang, Minseok Song, Daehyung Park
日本語で読む → - 論文制御理論math.DS
微分平坦システムのα安定性と車両ダイナミクスへのニュートン・ラフソン追従制御の応用
微分平坦な非線形システムのα安定性を解析し、ニュートン・ラフソン追従制御器の適用条件を示した。キネマティック・ユニサイクルとダイナミック・バイシクルモデルで有効性を実証した。
原題: $α$-stability of Differentially Flat Systems with Application to Newton-Raphson Tracking Control for Vehicle Dynamics / Aadila Ali Sabry, Gennaro Notomista
日本語で読む → - 論文世界モデルAI
物理的に実行可能な世界モデル:クエリ条件付き身体化AIの事例
身体化AIの世界モデルは、将来の観測予測ではなく、介入クエリに答えるために物理構造を表現すべきであり、観測予測型モデルの物理的誤りを指摘し、モジュール構成とオーケストレータによる設計原理を提案する。
原題: Physically Viable World Models: A Case for Query-Conditioned Embodied AI / Adam J. Thorpe, Stepan Tretiakov, Cheng-Hsi Hsiao 他
日本語で読む → - 論文音声ディープフェイク検出cs.SD
クロスアテンション特徴融合による半真実音声の位置特定を伴う音声ディープフェイク検出
本論文は、一部だけが合成された「半真実」音声を検出し、その改ざん区間を特定する新しいモデルCAFNetを提案する。MFCC、LFCC、Chroma-STFT特徴を並列畳み込みとクロスアテンションで融合し、3値分類と境界回帰を同時に行う。
原題: Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion / S. Sutharya, Remya K. Sasi
日本語で読む → - 論文シミュレーションcs.GR
ClothTransformer: 統一潜在空間トランスフォーマーによるスケーラブルな布地シミュレーション
布地シミュレーションを学習された潜在空間での自己回帰シーケンスモデリングとして再定式化し、多様なシナリオを単一モデルで扱える統一トランスフォーマーを提案。従来手法より誤差を約4〜9倍低減し、メッシュ解像度に依存しないスケーラブルな計算を実現した。
原題: ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation / Yu Zhang, Yidi Shao, Wenqi Ouyang 他
日本語で読む → - 論文VLA/攻撃/転移性画像認識
VLA-Hijack: 視覚的プロプリオセプション乗っ取りによる視覚言語行動モデルへの転移可能なパッチ攻撃
VLAモデルが動作計画前にロボットアームの自己位置を視覚で特定する共通の脆弱性を突き、注意誘導型プロプリオセプション抑制とマルチモーダル注入によりパッチを偽の身体として埋め込む転移可能な攻撃手法を提案した。
原題: VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking / Jiyuan Fu, Kaixun Jiang, Jingkai Jia 他
日本語で読む → - 論文強化学習機械学習
LLM報酬設計が失敗するとき:スパース構造化RLのための診断駆動型改良
スパースで構造化された強化学習タスクにおいて、LLMによる報酬整形を一回生成ではなくデバッグとして捉え、訓練診断と失敗モード分類に基づく反復改良を提案し、DoorKey-8x8やKeyCorridorの成功率を大幅に向上させた。
原題: When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL / Youting Wang, Yuan Tang, Bowen Liu 他
日本語で読む → - 論文VLA画像認識
GEM: 生成的監視が身体化知能を強化する
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
原題: GEM: Generative Supervision Helps Embodied Intelligence / Ruowen Zhao, Bangguo Li, Zuyan Liu 他
日本語で読む → - 論文世界モデル画像認識
Gamma-World: 2人を超える生成型マルチエージェント世界モデル
複数エージェントが同時に動作する環境向けの生成型世界モデルを提案し、エージェントの対称性を保つ符号化と効率的な注意機構により、リアルタイムなインタラクティブシミュレーションを実現した。
原題: Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players / Fangfu Liu, Kai He, Tianchang Shen 他
日本語で読む →