論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/14 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文マニピュレーションロボティクス
受動力制御を用いた協調フレキシブルペイロード操作における振動抑制
2台の産業用ロボットアームをリーダー・フォロワー構成で用い、柔軟なペイロードの運動中の横振動を抑制する制御戦略を提案した。フォロワー側のアドミッタンス制御により外力に追従させ、エネルギー消散を保証する。
原題: Vibration Suppression in Collaborative Flexible Payload Manipulation Using Passive Force Control / Alaa Abderrahim, Antonio Rosales, Ferdinando Milella 他
日本語で読む → - 論文自動運転レース/軌道計画ロボティクス
自動運転レースにおける最小時間軌道計画のための制御情報に基づく制約適応
自動運転レースで、実行時の追従誤差を学習して軌道計画の空間制約を動的に調整し、タイムを短縮する手法を提案。
原題: Control-Informed Constraint Adaptation in Minimum-Time Trajectory Planning for Autonomous Racing / Ann-Kathrin Schwehn, Alexander Langmann, Mattia Piccinini 他
日本語で読む → - 論文リハビリテーションロボティクス
THRIVE: 仮想環境における治療用ヒューマノイドロボット
家庭で使えるリハビリプラットフォームで、VRゲーム、カメラによる動作追跡、ロボットセラピストを組み合わせ、上肢運動障害のある子供の治療を支援する。
原題: THRIVE: Therapeutic Humanoid Robot In Virtual Environment / Jin Xu, Yu-Ping Chen, Ayanna Howard
日本語で読む → - 論文VLA/ロボットマニピュレーションロボティクス
想像による回復:推論時カウンターファクチュアル再調整による視覚言語行動モデルの復旧
視覚言語行動モデルがオンラインの外乱(目標変更や物理的摂動)に直面した際、失敗データや再学習なしに、推論時に「もしも」の継続を想像してロボットと環境を最小限に再調整する訓練不要の回復フレームワークを提案した。
原題: Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models / Yanyan Zhang, Disheng Liu, Kai Ye 他
日本語で読む → - 論文ワールドモデル機械学習
JEPAワールドモデルの診断:行動条件付き予測整合性に基づく評価
JEPAワールドモデルが視覚的摂動に対して頑健かどうかを、行動条件付き予測の整合性(ACPC)という指標で診断する手法を提案した。
原題: Diagnosing JEPA World Models with Action-Conditioned Predictive Consistency / Guo An, Zijing Wu, Honghua Dong 他
日本語で読む → - 論文空間推論/VLM/自己進化AI
空間記憶エージェント:空間知能のための経験に基づく手順記憶
凍結されたVLMエージェントが、外部ツールやパラメータ更新なしに、検証可能な空間環境での経験から教訓を抽出・蓄積し、推論時に再利用することで空間推論能力を向上させるフレームワークを提案した。
原題: Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence / Haokai Zhang, Yuhang Ding, Yunshu Zhou 他
日本語で読む → - 論文組み立て学習AI
意味的制約下での未知部品を用いた新規構造の組み立て学習
訓練時には存在しなかった意味的制約(どの部品タイプや特徴が有効な構造を作るか)を、対話とデモンストレーションから学習し、新しい構造を組み立てるニューロシンボリックアーキテクチャを提案した。
原題: Learning to Assemble Novel Structures with Unfamiliar Parts under Semantic Constraints / Jonghyuk Park, Alex Lascarides, Subramanian Ramamoorthy
日本語で読む → - 論文ブロックチェーン解析cs.CR
解釈可能なブロックチェーン・フォレンジックのための持続的行動パターン発見
大規模なブロックチェーン活動から、アプリケーションに依存しない持続的な行動パターンを発見するフレームワークを提案。イーサリアムの3000万件以上の取引で評価し、日常的および悪意のあるパターンを解釈可能な形で特定する。
原題: Discovering Persistent Behavioural Patterns for Interpretable Blockchain Forensics / Dorottya Zelenyanszki, Zhe Hou, Kamanashis Biswas 他
日本語で読む → - 論文プログラム生成/シミュレーションAI
モデルコンテキストプロトコルによる検索基盤ロボットプログラム生成とシミュレーションに基づく修正
自然言語のタスク記述からABB RAPIDロボットプログラムを生成し、検索拡張生成とRobotStudioシミュレーションを組み合わせて自動修正するワークフローを提案した論文。
原題: Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol / Zhichao Zhou, Siyuan Chen, Omkar Salunkhe 他
日本語で読む → - 論文強化学習/時相論理AI
信号時相論理のための報酬機械
信号時相論理(STL)仕様を強化学習で満たすための、オートマトンに基づく効率的な記憶機構とマルコフ報酬を導入し、既存のロバスト性報酬より高い満足率とロバスト性を達成した。
原題: Reward Machines for Signal Temporal Logic / Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai
日本語で読む → - 論文顔偽造検出画像認識
ビデオと画像の統一表現学習によるビデオ顔偽造検出
ビデオ内の一部フレームのみが改ざんされた部分偽造を検出するため、追加の注釈付き画像を活用して細かい監視を行う統一エンコーダとマルチタスク学習を備えたフレームワークUVIFを提案した。
原題: Learning Unified Video and Image Representation for Video Face Forgery Detection / Haotian Liu, Yang Liu, Guoying Zhao 他
日本語で読む → - 論文医療画像診断画像認識
アルツハイマー病の特異的識別に向けた転移学習の出現:将来を見据えたアプローチ
アルツハイマー病の診断における転移学習の応用をレビューし、限られたデータでも診断精度を向上させる可能性と、説明可能なAIの統合について評価した論文。
原題: Emergence of Transfer Learning towards Specific Identification of Alzheimer's Disease A Prospective Approach / Soumik Podder, Chandramouli Haldar
日本語で読む → - 論文LLM/レイアウト最適化AI
シミュレーション認識型インコンテキストポリシー改善によるLLM支援アナログレイアウト最適化
アナログICレイアウト生成のパラメータ調整を、LLMマルチエージェントがシミュレーション結果を観察しながら反復改善する手法を提案し、少数のシミュレーションで性能を向上させた。
原題: Simulation-Aware In-Context Policy Improvement for LLM-Aided Analog Layout Refinement / Bingyang Liu, Ziming Wei, Xiaohan Gao 他
日本語で読む → - 論文ナビゲーションロボティクス
Graph-MambaNav: 物体関係知識を活用した空間時間グラフMambaによる物体目標ナビゲーション
物体目標ナビゲーションにおいて、物体間の関係性と目標関連性に基づくノード優先順位付けを導入した空間時間グラフエンコーディングフレームワークを提案し、AI2-THORとRoboTHORで性能向上を実証した。
原題: Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation / Leyuan Sun, Genxin Chen, Linwei Ye 他
日本語で読む → - 論文医療AI機械学習
介入を考慮した臨床世界モデルによる心臓術後転帰予測
術後の不規則な経過を考慮し、患者の潜在状態を時間経過とともに更新する臨床世界モデルを提案。心房細動アブレーション後の再発予測で高い精度を達成した。
原題: Intervention-Aware Clinical World Model for Post-Op Outcome Forecasting in Cardiology / Yunsung Chung, Yingshuo Liu, Abboud F. Hassan 他
日本語で読む → - 論文画像分類画像認識
MLLMルーティングによる異種アンサンブルを用いた頑健なクロスデータセット画像分類
マルチモーダル大規模言語モデル(MLLM)エージェントが各画像を最適な視覚バックボーンに動的ルーティングするアンサンブル手法ARMDILを提案し、複数データセットにまたがる画像分類の頑健性と適応性を向上させた。
原題: MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification / Daniel Perkins, John Squires, Janou Milligan 他
日本語で読む → - 論文敵対的攻撃画像認識
UniTexture: 視覚言語行動モデルに対するクロスタスク普遍敵対的テクスチャ
単一のテクスチャ付き3Dオブジェクトを用いて、複数のタスクにわたってVLAモデルの行動予測を敵対的に逸脱させる普遍的な攻撃手法を提案した。
原題: UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models / Yukun Dai, Mingzhe Dai, Tianshi Wang 他
日本語で読む → - 論文エージェントアーキテクチャAI
SLMとエッジコンピューティングによる仮想エージェントの強化:思考と記憶プロセスの探索的評価
小型言語モデルとエッジコンピューティングを用いて、仮想世界のエージェントの認知機能(思考と記憶)を部分的に実装し、NVIDIA Jetson上で評価した論文。
原題: Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes / Aimilios Hadjiliasi, Louis Nisiotis
日本語で読む → - 論文VLA画像認識
社会的音声・視覚質問応答における推論:現状はどこにあるのか?
社会的音声・視覚理解のためのMLLMの推論手法を検証し、既存ベンチマークのノイズを除去したIntentBench-Primeを公開。単純なVanilla SFTが高コストな推論手法と同等以上の性能を示すことを発見した。
原題: Reasoning for Social Audio-Visual Question Answering: Where Do We Stand? / Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera 他
日本語で読む → - 論文連合学習/セキュリティ機械学習
垂直連合学習におけるバックドア脆弱性の理解:研究と実践のギャップ
垂直連合学習(VFL)におけるバックドア攻撃の脆弱性を実践的な観点から系統的に調査し、既存研究が非現実的な前提に依存していることを明らかにした。また、現実的な制約下での脅威モデルを再定義し、実用的なバックドアワークフローとベンチマークBVBenchを提案している。
原題: Understanding Backdoor Vulnerabilities in Vertical Federated Learning: The Gap Between Research and Practice / Ziqi Zhao, Jialin Lu, Junjie Shan 他
日本語で読む → - 論文計画/世界モデル機械学習
目的関数がボトルネック:潜在世界モデルはプランナーが使えない情報を符号化する
潜在世界モデルによる長期計画の失敗は予測精度ではなく、プランナーの目的関数に起因することを示し、目的関数の変更だけで成功率を大幅に向上させた。
原題: The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use / Joyjeet Singh
日本語で読む → - 論文拡散モデル画像認識
意味的ステアリングによる制御可能な生成:マルチモーダル拡散トランスフォーマーにおけるチューニング不要の概念消去
マルチモーダル拡散トランスフォーマー(MM-DiT)の内部表現を操作し、学習なしで不要な概念を消去する手法を提案。中間ブロックのテキスト条件付き表現からステアリングベクトルを構築し、注入することで安全な生成を実現する。
原題: Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers / Qiao Li, Xiaomeng Fu, Yuanshu Zhao 他
日本語で読む → - 論文能動学習/障害発見AI
ペアシステムを用いた障害発見のためのカバレッジ考慮型能動評価
限られたテスト予算で実世界の障害を効率的に発見するため、プロキシシステムの情報を活用しつつ、実システムの評価結果と組み合わせて障害が起きそうなシナリオを適応的に選択する手法を提案した。
原題: Coverage Aware Active Evaluation for Failure Discovery with Paired Systems / Anjali Parashar, Rachel Luo, Apoorva Sharma 他
日本語で読む → - 論文操作/時間論理/世界モデルロボティクス
hint$^2$: 推論時時間論理ガイダンスのための階層的世界モデル
ロボットの操作ポリシーを線形時間論理(LTL)で表される複雑な指示に従わせるため、階層的世界モデルを用いて推論時に高レベルと低レベルの2つのガイダンスを生成する手法を提案した。
原題: hint$^2$: Hierarchical World Models for Inference-Time Temporal Logic Guidance / Moritz Zoellner, Anastasios Manganaris, Ahmed H. Qureshi 他
日本語で読む → - 論文強化学習機械学習
世界モデルによる自動研究エージェントのスケーリング
自動研究エージェントの強化学習において、環境実行がボトルネックになる問題を解決するため、世界モデルで環境を置き換えるWMRLを提案し、バイアス補正とノイズ抑制で性能を向上させた。
原題: Scaling Automatic Research Agents via World Models / Xiyuan Yang, Sheikh Sarwar, Jingru Cheng 他
日本語で読む → - 論文世界モデル/計画AI
ARC-Bench:凍結JEPA世界モデルにおける閉ループ再計画が破綻した行動ランキングを隠蔽する
凍結したJEPA潜在空間での距離に基づく行動選択が実際のコスト順序と一致するという仮定を監査し、公式チェックポイントで深刻なランキング逆転が生じることを示した。さらに、頻繁な再計画がこの欠陥を隠していることを明らかにした。
原題: ARC-Bench: Closed-Loop Replanning Masks Broken Action Ranking in Frozen JEPA World Models / Zhengshu Zhang, Zhiyuan Li
日本語で読む → - 論文ベンチマーク画像認識
AeroGround: 航空・地上協調推論のための包括的ベンチマーク
UAVと地上の協調シナリオにおける視覚言語モデルの推論能力を評価する新しいベンチマークを提案し、既存モデルと人間の性能差を明らかにした。
原題: AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning / Shenghong Yi, Lin Zhang, Muzian Li 他
日本語で読む → - 論文マルチタスク学習/最適化機械学習
MOON: マルチタスク学習のための多目的正規直交更新
マルチタスク学習における勾配操作を、行列構造を考慮したスペクトル・核ノルム幾何で行う新しい最適化手法を提案し、理論的収束保証と実験的改善を示した。
原題: MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning / Shiji Zhou, Kunlin Lyu, Lei Zhang 他
日本語で読む → - 論文ビデオ推論画像認識
動きをプロンプトとして:動き誘導型クロスフレーム視覚プロンプティングによるマルチモーダル大規模言語モデルの動き推論の強化
動き中心のビデオ推論を強化するため、軌跡を視覚入力に直接マークするフレームワークを提案し、既存のMLLMの性能を向上させた。
原題: Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting / Xikai Sun, Kebin Liu, Haotian Wang 他
日本語で読む → - 論文自動運転/リスク識別ロボティクス
RiskWorld: 自動運転リスク識別のためのオブジェクト中心潜在世界モデル
自動運転におけるリスク対象を特定するため、オブジェクト中心の潜在世界モデルを提案し、将来の関係を予測してリスクスコアを出力する。RiskBenchで最高のF1値と最低の誤警報率を達成した。
原題: RiskWorld: Object-Centric Latent World Modeling for Autonomous Driving Risk Identification / Jingzheng Li, Yufei Ge, Qianren Mao 他
日本語で読む →