論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文状態推定ロボティクス
四足歩行ロボットの自己位置推定における固有感覚のみを用いたベンチマーク:ATE、RPE、フィルタとスムーザの実行時間トレードオフ
四足歩行ロボット用の3つの自己位置推定手法(MUSE、IEKF、IS)を公開データセットで比較し、精度と計算時間のトレードオフを評価した論文。
原題: A Proprioceptive-Only Benchmark for Quadruped State Estimation: ATE, RPE, and Runtime Trade-offs Between Filters and Smoothers / Ylenia Nisticò, João Carlos Virgolino Soares, Joan Solà 他
日本語で読む → - 論文強化学習機械学習
オフダイナミクス強化学習のためのクロスドメインエネルギー誘導拡散生成
遷移ダイナミクスが異なる環境間で、ソースデータセットからターゲット領域のポリシーを学習する際に、エネルギー誘導を用いて軌道レベルの拡散生成を行い、ターゲット領域に適応した合成データを生成する手法CEDGEを提案した。
原題: Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning / Yu Yang, Yihong Guo, Anqi Liu 他
日本語で読む → - 論文VLAAI
LoopVLA: 反復的改良における十分性学習による視覚言語行動モデル
視覚言語行動モデルにおいて、表現の十分性を推定しながら反復的に改良を行う新しいアーキテクチャを提案し、計算効率と精度のバランスを改善した。
原題: LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models / Boyang Shen, Kaixiang Yang, Hao Wang 他
日本語で読む → - 論文ナビゲーションロボティクス
MCNav: 記憶を考慮した動的認知地図によるゼロショット目標指向ナビゲーション
探索済み領域の情報を活用する記憶対応ナビゲーションフレームワークを提案し、目標の再検証と再探索戦略によりナビゲーション失敗を低減する。
原題: MCNav: Memory-Aware Dynamic Cognitive Map for Zero-shot Goal-oriented Navigation / Jingyu Li, Zhe Liu, Wenxiao Wu 他
日本語で読む → - 論文データセット画像認識
LRDDv3: 距離情報と熱画像を備えた高解像度長距離ドローン検出データセット
長距離ドローン検出のための高解像度RGB画像と熱画像を含む大規模データセットを構築し、距離情報も提供する。
原題: LRDDv3: High-Resolution Long-Range Drone Detection Dataset with Range Information and Thermal Data / Knut Peterson, Zaid Mayers, Azmain Yousuf 他
日本語で読む → - 論文操作ロボティクス
ElasticFlow: 弾性時間地平線を用いた一段階物理整合ポリシーによる言語誘導操作
拡散ポリシーの遅延問題を解決するため、蒸留不要で物理整合性を保つ一段階生成フレームワークを提案し、時間地平線の弾性化で言語指示と動作の粒度を整合させた。
原題: ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation / Kewei Chen, Yayu Long, Shuai Li 他
日本語で読む → - 論文VLAロボティクス
RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデル
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
原題: RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models / Weijia Liufu, Xiaoyu Guo, Ruiyi Chen 他
日本語で読む → - 論文強化学習機械学習
信頼領域Q-随伴マッチング
事前学習済みフローポリシーのオフポリシー強化学習を安定化するため、経路空間KLを信頼領域パラメータで制御するTRQAMを提案し、50のOGBenchタスクで既存手法を上回る性能を達成した。
原題: Trust Region Q Adjoint Matching / Yonghoon Dong, Kyungmin Lee, Changyeon Kim 他
日本語で読む → - 論文VLAロボティクス
AwareVLN: 自己認識による視覚言語ナビゲーションの推論
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
原題: AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation / Wenxuan Guo, Xiuwei Xu, Yichen Liu 他
日本語で読む → - 論文触覚ロボティクス
ヒューマノイドロボットにおける身体的感情タッチ戦略のマッピング
iCubロボットを用いて、参加者が8つの感情を自由・腕のみ・胴体のみの3条件で表現し、身体部位と空間的制約がタッチ位置と動態に与える影響を調査した研究。
原題: Mapping Embodied Affective Touch Strategies on a Humanoid Robot / Qiaoqiao Ren, Omar Eldardeer, Francesca Cocchella 他
日本語で読む → - 論文空中マニピュレーションロボティクス
空中マニピュレーションのためのクロスカップリングとレジーム依存ダイナミクスの学習
空中マニピュレータの残差ダイナミクスを適応的に学習する構造化エンコーダ・デコーダフレームワークを提案し、実機実験で予測精度とMPC追従性能を向上させた。
原題: Learning Cross-Coupled and Regime Dependent Dynamics for Aerial Manipulation / Rishabh Dev Yadav, Samaksh Ujjawal, Sihao Sun 他
日本語で読む → - 論文SLAMロボティクス
MAGS-SLAM: 単眼マルチエージェント・ガウススプラッティングSLAMによる幾何・光度整合的な再構成
RGBカメラのみを用いた複数エージェントによる3DガウススプラッティングSLAMを提案し、各エージェントが局所サブマップを構築して圧縮情報を交換することで、深度センサなしで協調的な高品質3D再構成を実現した。
原題: MAGS-SLAM: Monocular Multi-Agent Gaussian Splatting SLAM for Geometrically and Photometrically Consistent Reconstruction / Zhihao Cao, Qi Shao, Shuhao Zhai 他
日本語で読む → - 論文群制御ロボティクス
AirBender: 二重UAVによる曲げ可能物体の適応的輸送
この論文では、2台のUAVが協調して曲げ可能な物体を軌道に沿って輸送するための適応制御器を提案し、物体の弾性特性を事前に知らなくても安定した追従を実現する。
原題: AirBender: Adaptive Transportation of Bendable Objects Using Dual UAVs / Jiawei Xu, Longsen Gao, Rafael Fierro 他
日本語で読む → - 論文VLM評価AI
VLMの解釈可能な故障モードの解明
視覚言語モデル(VLM)の安全上重要な応用における故障モードを体系的に発見するフレームワークREVELIOを提案し、自動運転と屋内ロボット分野で未報告の脆弱性を明らかにした。
原題: Revealing Interpretable Failure Modes of VLMs / Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva 他
日本語で読む → - 論文継続学習/VLAロボティクス
視覚言語行動モデルは実世界データから忘れずに継続学習できるか?
実世界のロボット連続操作タスクでVLAモデルの継続学習を検証し、経験再生が破滅的忘却を防ぎ、ジョイント訓練と同等以上の性能を達成することを示した。
原題: Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting? / Jiarun Zhu, Yijun Hong, Xiaoquan Sun 他
日本語で読む → - 論文ナビゲーションロボティクス
VLM-LLMナビゲーションにおけるボトルネックの探求:3Dシーン理解能力がゼロショットVLNに与える影響
ゼロショット視覚言語ナビゲーション(VLN)における3Dシーン理解の精度がナビゲーション性能に与える影響を定量化し、知覚精度の向上が一定以上で効果が頭打ちになる「知覚飽和現象」を明らかにした。
原題: Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN / Ziyi Xia, Chaoran Xiong, Litao Wei 他
日本語で読む → - 論文ナビゲーションロボティクス
TARIC: 遮断された意味的手がかり下でのメモリ拡張型・走行可能性認識屋外視覚言語ナビゲーション
屋外視覚言語ナビゲーションにおいて、意味的手がかりが途切れる状況でも、走行可能性を考慮した実行可能なガイダンスを維持する統合フレームワークを提案。3Dキューメモリと不確実性を考慮した読み出し機構により、長期的な手がかり欠如フェーズでも安定したナビゲーションを実現する。
原題: TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues / Tianle Zeng, Hanjing Ye, Jianwei Peng 他
日本語で読む → - 論文データ生成/操作ロボティクス
Lucid-XR: ロボット操作のための拡張現実データエンジン
XRヘッドセット上で動作する物理シミュレーションとビデオ生成を組み合わせ、多様な合成データを生成してロボットの視覚ポリシーを訓練し、実環境へのゼロショット転移を実現する。
原題: Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation / Yajvan Ravan, Adam Rashid, Alan Yu 他
日本語で読む → - 論文自動運転/安全性評価ロボティクス
位置推定の不確かさ下での自動運転のための信念空間残余リスク
自動運転の安全性評価において、自車位置の不確かさをガウス分布として明示的にモデル化し、残余リスクを信念空間で再定式化する手法を提案した。粒子ベースのリスク推定で、自車と物体の不確かさの共分散融合により衝突確率を計算する。
原題: Belief-Space Residual Risk for Automated Driving under Localization Uncertainty / Nijinshan Karunainayagam, Nils Gehrke, Frank Diermeyer
日本語で読む → - 論文生成モデル/物理シミュレーション機械学習
物理的シーケンスモデリングにおける誤一般化のメカニズム
生成シーケンスモデルが物理量の分布を誤って学習する「物理的誤一般化」のメカニズムを解明し、データ偏差カーネルを用いて予測・緩和する手法を提案した論文。
原題: Mechanisms of Misgeneralization in Physical Sequence Modeling / Kento Nishi, Raphael Tang, Karun Kumar 他
日本語で読む → - 論文3Dインスタンス分割画像認識
EvObj: シーン教師なしで3Dインスタンス分割を行う進化的オブジェクト中心表現の学習
合成データと実点群の形状ギャップを埋める、教師なし3Dインスタンス分割手法EvObjを提案。物体候補を動的改良する識別モジュールと部分形状を補完するモジュールを統合し、最先端性能を達成した。
原題: EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision / Jiahao Chen, Zihui Zhang, Yafei Yang 他
日本語で読む → - 論文マニピュレーションロボティクス
想像をいつ信じるか:ワールドアクションモデルにおける適応的アクション実行
ロボット操作のためのワールドアクションモデル(WAM)において、予測と実世界の観測の一致度を検証する軽量な検証器(FFDC)を導入し、実行するアクション数を適応的に調整する手法を提案した。
原題: When to Trust Imagination: Adaptive Action Execution for World Action Models / Rui Wang, Yue Zhang, Jiehong Lin 他
日本語で読む → - 論文遠隔操作ロボティクス
IMUモーションキャプチャによる人型ロボットのリアルタイム全身遠隔操作:Sim2SimとSim2Real検証
IMUベースのモーションキャプチャスーツで計測した人間の動作をUnitree G1人型ロボットに直接マッピングし、オフライン処理や学習を用いずに低遅延で全身遠隔操作するシステムを構築。シミュレーションと実機の両方で安定した動作再現を実証した。
原題: Real-Time Whole-Body Teleoperation of a Humanoid Robot Using IMU-Based Motion Capture with Sim2Sim and Sim2Real Validation / Hamza Ahmed Durrani, Suleman Khan
日本語で読む → - 論文VLA画像認識
LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディング
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
原題: LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding / Shihao Wang, Shilong Liu, Yuanguo Kuang 他
日本語で読む → - 論文歩行者安全/測位技術ロボティクス
歩行者衝突回避のための測位技術評価
歩行者衝突回避システム向けに、UWBとBluetooth 6.0の測位精度をGNSSと比較評価した論文。実験により、特定シナリオでの代替・補完可能性を示した。
原題: Assessing Localization Technologies for Pedestrian Collision Avoidance / Joshua Varughese, Joseba Gorospe, Novel Certad 他
日本語で読む → - 論文強化学習/着陸ロボティクス
荒れた海面への視覚に基づく機敏な着陸
強化学習を用いて、移動する海上プラットフォームへのマルチローターの自律着陸を、プラットフォームの状態推定なしで視覚特徴のみから実現する手法を提案した。
原題: Vision-Based Agile Landing on Turbulent Waters / Dimosthenis Angelis, Leonard Bauersfeld, Davide Scaramuzza 他
日本語で読む → - 論文医療用ロボット/カテーテルロボティクス
磁気駆動カテーテルの集中曲げのための剛性最適化:勾配剛性下での操舵性維持
磁気駆動ソフトカテーテルにおいて、推進力伝達と近位集中曲げの両立を目指し、剛性分布を最適化した多セグメントカテーテルを提案。実験で安定した曲げと直進前進を実証した。
原題: Stiffness Optimization for Concentrated Bending in Magnetically Actuated Catheters: Maintaining Steerability under Gradient Stiffness / Jiewen Tan, Junnan Xue, Shing Shin Cheng 他
日本語で読む → - 論文位置認識画像認識
MAG-VLAQ: マルチモーダル航空・地上クエリ集約によるクロスビュー位置認識
地上画像とLiDAR、航空画像を統合し、ODEベースの融合とVLAQを用いてクロスビュー位置認識の精度を大幅に向上させた。
原題: MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition / Zhengyi Xu, Yuhang Ming, Zhihao Zhan 他
日本語で読む → - 論文VLAロボティクス
視覚プリミティブによる行動生成
視覚言語行動モデルにおいて、視覚プリミティブを介して行動生成を行う新しいアーキテクチャを提案し、実ロボットのピックアンドプレースタスクで成功率を大幅に向上させた。
原題: Action with Visual Primitives / Weilong Guo, Yuchen Wang, Renping Zhou 他
日本語で読む → - 論文経路計画ロボティクス
経路ベースセンサのためのベイジアンネットワーク:通信不能環境における情報収集と経路計画
経路に沿った観測結果(例:危険検知の有無)から事象の空間分布を推定するベイジアンネットワーク手法を提案し、情報利得を最大化する経路計画を行う。
原題: Bayesian Networks for Path-Based Sensors: Gathering Information and Path Planning in Communication Denied Environments / Alkesh K. Srivastava, George P. Kontoudis, Donald Sofge 他
日本語で読む →