論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/5 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3Dトラッキング/再識別画像認識
外観は役立つのか?オンライン3Dマルチ歩行者追跡における画像ベース再識別の体系的研究
LiDARベースの3D追跡に軽量な画像ベース再識別を統合し、外観と動きの特徴をカスケード方式で統合することで、精度を保ちつつ隠れた歩行者の追跡を回復できることを示した研究。
原題: Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking / Eduardo Borges, Luís Garrote, Urbano J. Nunes
日本語で読む → - 論文ブロックチェーン/データ経済cs.CR
インテリジェントなサイバー・物理・社会システムのためのブロックチェーン基盤:具現化AI時代における耐量子セキュリティ、相互運用性、信頼できるデータ経済
具現化AIと量子コンピューティングの進展に対応するため、ブロックチェーンを耐量子暗号とデータ共有を実現する基盤として解説するチュートリアル。
原題: Blockchain Infrastructure for Intelligent Cyber--Physical--Social Systems:Post-Quantum Security, Interoperability, and Trustworthy Data Economies in the Era of Embodied AI / Song Guo, Huawei Huang, Dongping Liu 他
日本語で読む → - 論文VLA画像認識
TBD-VLA: 時間ブロック拡散を用いた視覚言語行動モデル
離散トークン型の視覚言語行動モデル(VLA)において、行動系列を時間ブロックに分割し、ブロック内ではマスク拡散、ブロック間では自己回帰生成を行うことで、時間的一貫性と推論速度を両立する新しいフレームワークを提案した。シミュレーションと実機操作タスクで既存手法を上回る性能を示した。
原題: TBD-VLA: Temporal Block Diffusion Vision Language Action Model / Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo
日本語で読む → - 論文VLA/行動表現ロボティクス
ActionMap: ボクセル行動ヒートマップによるロボットポリシー学習
既存のVLAモデルの行動デコーダを、行動空間上のボクセルヒートマップを予測するヘッドに置き換えることで、学習効率と性能を向上させる手法を提案した論文。
原題: ActionMap: Robot Policy Learning via Voxel Action Heatmap / Pei Yang, Hai Ci, Yanzhe Chen 他
日本語で読む → - 論文世界モデル画像認識
ビデオ世界モデルの潜在空間を行動関連にするもの:再構成よりも予測
ビデオ世界モデルの潜在表現が行動予測に有用となる要因を、統一的なプローブ評価で分析し、画素再構成よりも時間的予測が重要であることを示した論文。
原題: What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction / Jewon Yeom, Hanseul Kim, Jeongjae Park 他
日本語で読む → - 論文ナビゲーションロボティクス
MinNav: 光学フローを用いた小型空中ロボットのミニマリスト航法
単眼カメラの光学フローと不確実性を用いて、事前知識なしに静的・動的障害物や未知形状の隙間を飛行する航法スタックを提案し、実機実験で70%の成功率を達成した。
原題: MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots / Aniket Patil, Mandeep Singh, Uday Girish Maradana 他
日本語で読む → - 論文触覚推定/拡散モデル画像認識
EgoPressDiff: 自己中心視点のUV領域手圧力推定のためのマルチモーダルビデオ拡散
自己中心視点の映像から手の表面圧力を推定する新しいビデオ拡散フレームワークを提案。手のポーズと3Dメッシュ頂点、深度情報を組み合わせて圧力場を生成し、従来手法より精度を大幅に向上させた。
原題: EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation / Yuan Zeng, Zilue Gao, Yujia Shi 他
日本語で読む → - 論文強化学習機械学習
適応的質問と世界モデルプローブによる明示的行動モデルの学習
報酬のみで訓練されたエージェントの脆さを改善するため、明示的な記号的行動モデル(ESBM)を導入し、適応的質問と世界モデルプローブを用いて行動の仕組みを学習・検証する手法を提案した。
原題: Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes / Hikaru Shindo, Yu Deng, Teng Cao 他
日本語で読む → - 論文画像編集cs.GR
拡散編集における制御性と忠実性のフロンティアについて
拡散モデルによる画像編集の制御性と忠実性のトレードオフを理論的・実証的に分析し、編集手法の限界と安全対策を提案する論文。
原題: On the Controllability-Fidelity Frontier in Diffusion Editing / Yi Hu, Leying Yi, Emily Davis 他
日本語で読む → - 論文因果推論stat.ML
一般介入下での自動・デバイアス・不変な反事実生成
ADIGenという、一般介入(高次元介入・結果を含む)に対する反事実生成の枠組みを提案。Riesz回帰、因果不変性、直交統計学習を組み合わせ、密度比推定の不安定性や分布シフト、モデル誤特定によるバイアスを克服する。
原題: Automatic, Debiased, and Invariant Counterfactual Generation under General Interventions / Raphael C Kim, Jingsen Zhu, Ramin Zabih 他
日本語で読む → - 論文自動運転安全規格ロボティクス
自動運転時代のISO 26262再考:転移可能性と予測可能性による制御可能性の強化
自動運転車向けにISO 26262の「制御可能性」を分解し、転移可能性と予測可能性という2つの測定可能な概念を導入して、フォールバックと相互作用の主張を検証可能にする枠組みを提案した論文。
原題: Re-imagining ISO 26262 in the Age of Autonomous Vehicles: Enhancing Controllability through Transferability and Predictability / Chaitanya Shinde, Hadi Hajieghrary, Paul Schmitt 他
日本語で読む → - 論文医療AI自然言語
大規模言語モデルが医療で失敗するとき:プロンプト変動に対する感度の評価
医療用大規模言語モデルがプロンプトの微妙な言い換えや構文変更に敏感で、診断や薬剤推奨が変わったり有害な出力を生じることを、MedMCQAベンチマークを用いた系統的解析で明らかにした。
原題: When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations / Mahdi Alkaeed
日本語で読む → - 論文表現学習機械学習
表現創発のブートストラップ理論:説明不足が表現学習と世界モデルを駆動する
表現学習において、既存の表現枠組みが説明不足に陥ったときに新しい表現レベルが必要となる過程を、5段階の再帰的プロセスとして理論化した概念枠組みを提案する論文。
原題: Bootstrap Theory of Representational Emergence: Explanatory Insufficiency as a Driver of Representation Learning and World Models / Jacques Raynal, Pierre Slangen, Elsa Raynal 他
日本語で読む → - 論文画像生成/拡散モデル画像認識
分解された視覚プロキシによる直接的な3D認識オブジェクト挿入
背景画像へのオブジェクト挿入を、3Dポーズ制御可能な拡散モデルベースのフレームワークDIRECTを提案。外観・幾何・文脈の3条件を分離注入し、高品質な合成とポーズ操作を両立する。
原題: Direct 3D-Aware Object Insertion via Decomposed Visual Proxies / Jingbo Gong, Yikai Wang, Yushi Lan 他
日本語で読む → - 論文制御制御
償却型非線形モデル予測制御
非線形モデル予測制御の計算負荷を軽減するため、状態依存の二次計画問題とニューラルネットワークによる残差補正を組み合わせ、実時間制御を高速化する手法を提案した。
原題: Amortized Nonlinear Model Predictive Control / Francesco Pillitteri, Alberto Bemporad
日本語で読む → - 論文ソフトロボティクスロボティクス
高速成長するつる型ロボットのための先端マウント設計とベンチマーキング
つる型ロボットの先端にセンサーを取り付けるための三角形ローラー式マウントを設計し、成長時の内部抵抗を低減。専用テストベッドで従来設計と比較し、最も低い張力と再現性の高い成長を実証した。
原題: Gotta Grow Fast: Design and Benchmarking of a Tip Mount for High-Speed Vine Robots / Antonio Alvarez Valdivia, Robert Reeve, Ankush Dhawan 他
日本語で読む → - 論文3Dシーン理解画像認識
PAR3D: 部品認識表現を用いた統合3Dマルチモーダル大規模言語モデルによるシーン理解
3Dシーン理解のための部品レベルの認識を可能にする統合3D-MLLMフレームワークPAR3Dを提案し、部品注釈付き合成データセットScenePartと階層的セグメンテーションクエリ生成により、部品レベルの質問応答と参照セグメンテーションを改善した。
原題: PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding / Shaohui Dai, Yansong Qu, You Shen 他
日本語で読む → - 論文布地操作画像認識
布地操作のための合成データ生成と視覚に基づくしわ・キーポイント検出
布地の操作を支援するため、Blenderで合成データを生成し、しわ検出器とキーポイント検出器を訓練。両手操作アルゴリズムでしわを利用して布を伸ばし、その後キーポイントでアイロン掛けを行う。
原題: Synthetic Data Generation and Vision-based Wrinkle and Keypoint Detection for Bimanual Cloth Manipulation / Ariel Herrera, Xueyang Kang, Atal Anil Kumar
日本語で読む → - 論文3Dセグメンテーション画像認識
T-FunS3D: タスク駆動型階層的オープンボキャブラリ3D機能セグメンテーション
ロボットが3Dシーン内の機能的オブジェクト部品をタスク記述に基づいて特定するための、タスク駆動型の階層的オープンボキャブラリ3D機能セグメンテーション手法を提案した。
原題: T-FunS3D: Task-Driven Hierarchical Open-Vocabulary 3D Functionality Segmentation / Jingkun Feng, Reza Sabzevari
日本語で読む → - 論文制御制御
水中潜水機の動的モデルに対する追従制御
水中車両の追従制御問題に対し、ハミルトン構造を保つ新しい誤差関数を導入し、エネルギーに基づく追従制御則を導出・検証した。
原題: Tracking Control for a Dynamic Model of an Underwater Submersible / Matthew Hampsey, Pieter van Goor, Ravi Banavar 他
日本語で読む → - 論文空間記憶/ビデオ理解画像認識
LongSpace: ビデオにおける知覚から想起までの長期的空間記憶の探求
長期的な空間記憶を評価するベンチマークLongSpace-Benchを導入し、3D構造的手がかりと層認識メモリを用いた空間推論フレームワークLongSpaceを提案した。
原題: LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video / Shiqiang Lang, Jing Liu, Haoyang He 他
日本語で読む → - 論文VLA/操作ロボティクス
AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデル
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
原題: AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding / Qize Yu, Jiadi You, Yuran Wang 他
日本語で読む → - 論文メタサーフェス設計physics.optics
改良された条件付けと多様性強化型段階的成長GANによる実現可能なメタサーフェス吸収体の逆設計
本論文は、連続的なスペクトル制約下で物理的に一貫したメタサーフェス合成を行う生成逆設計フレームワークを提案し、2〜18 GHzの反射特性を持つ実現可能な吸収体を生成する。
原題: Inverse Design of Realizable Metasurface based Absorbers using Improved Conditioning and Diversity Enhanced Progressively Growing GANs / Vineetha Joy, Mohammad Abdullah, Pramit Pal 他
日本語で読む → - 論文VLAロボティクス
世界・言語・行動モデル:統一的世界モデリング、言語推論、行動合成
テキスト指示、画像、ロボット状態から、テキストのサブタスク、サブゴール画像、ロボット行動を同時予測する新しい基盤モデルWLAを提案。ARトランスフォーマーを用いて世界予測と言語推論を統合し、推論時には世界予測を無効化できる。
原題: World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis / Yi Yang, Zhihong Liu, Siqi Kou 他
日本語で読む → - 論文安全性ロボティクス
長期的タスクのための安全な具現化AI:ロボット操作のクロスレイヤー分析
本論文は、長期的なロボット操作における安全性を、計画時・方策時・実行時の介入箇所に基づいて体系的にレビューし、各研究の証拠の強さを分析したサーベイである。
原題: Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation / Dabin Kim, Daemin Park, Sangyub Lee 他
日本語で読む → - 論文ソーシャルAI画像認識
共鳴する心:心の理論を備えた閉ループソーシャルアバター
認知推論とマルチモーダル生成を統合した閉ループデュアルエージェントフレームワークを提案し、心の理論による社会的推論と感情制御可能な動画生成を組み合わせて、リアルな対話と表情・反応を実現する。
原題: Resonant Minds: Closed-Loop Social Avatars with Theory of Mind / Jianxu Shangguan, Jing Xu, Hang Ye 他
日本語で読む → - 論文システム工学ロボティクス
IDDMBSE:データ駆動型とモデルベースのシステム工学を統合した自律サイバー物理システムの信頼性確保手法
モデルベースシステム工学(MBSE)とデータ駆動型ML/AIを統合する新しいシステム工学手法IDDMBSEを提案し、SysMLベースのツールチェーン(PERFECT、TRADES-X、VERITAS)を実装して自律地上ロボットの開発ライフサイクル全体で実証した。
原題: IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems / John S. Baras, Sai Sandeep Damera, Ryan Matheu 他
日本語で読む → - 論文LLMエージェント評価機械学習
LLMエージェントのオフ方策評価のための自己回帰拡散ワールドモデル
事前収集した軌跡のみから、新しいLLMエージェント方策の性能を推定する評価フレームワークADWMを提案。各遷移を独立した拡散過程としてモデル化し、方策条件付きスコア関数でエージェントの意思決定を反映したシミュレーションを実現する。
原題: Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents / Kaixuan Liu, Guojun Xiong, Weinan Zhang 他
日本語で読む → - 論文VLAロボティクス
ActiveMimic: 能動的知覚を備えた自己中心視点ビデオ事前学習
自己中心視点の人間ビデオから能動的知覚(カメラ動作)を活用してロボット操作を事前学習するフレームワークを提案し、ロボットデータ事前学習と同等の性能を実現した。
原題: ActiveMimic: Egocentric Video Pretraining with Active Perception / Xingyao Lin, Guojin Zhong, Tianyi Lu 他
日本語で読む → - 論文ナビゲーションAI
WorldFly: UAVナビゲーションのためのワールドモデル基盤の視覚言語行動モデル
UAVナビゲーションのための新しいVLAフレームワークで、将来の映像予測と行動を同時生成するデュアルブランチ結合フローマッチング機構を導入し、空間想像による意思決定を強化する。
原題: WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation / Shengtao Zheng, Kai Li, Weichen Zhang 他
日本語で読む →