論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習ロボティクス
階層的マクロ行動量子化による強化学習エージェントの人間らしさ向上
人間のデモンストレーションを階層的なベクトル量子化でマクロ行動に符号化し、報酬を最大化しつつ人間らしい行動系列を予測する強化学習フレームワークHiMAQを提案した。
原題: Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization / Usman Nizamani, M. Shaheer Luqman, Fawad Javed Fateh 他
日本語で読む → - 論文ナビゲーションロボティクス
動的環境におけるロボットナビゲーションのための意味論的リスク認識ヒューリスティック計画法:LLMに着想を得たアプローチ
LLMの推論原理を古典的な経路計画に取り入れ、混雑・高リスク領域を罰するコスト関数をA*探索に組み込んだ意味論的リスク認識ヒューリスティック計画法を提案し、動的障害物検知時の再計画で性能を評価した。
原題: Semantic Risk-Aware Heuristic Planning for Robotic Navigation in Dynamic Environments: An LLM-Inspired Approach / Hamza Ahmed Durrani, Rafay Suleman Durrani
日本語で読む → - 論文マニピュレーションロボティクス
効率的なKoopman作用素ベースモデル予測制御による動的ロボット布折りたたみ
布の動的折りたたみを高速かつ正確に行うため、物理シミュレーションとKoopman作用素回帰を用いた線形モデルをモデル予測制御に組み込み、折りたたみ軌道を効率的に生成する手法を提案した。
原題: Dynamic robotic cloth folding with efficient Koopman operator-based model predictive control / Edoardo Caldarelli, Franco Coltraro, Adrià Colomé 他
日本語で読む → - 論文誘導制御制御
入力制約付き真比例航法による迎撃時間制御
目標迎撃時間を制御する非線形誘導則を提案。制御入力の上限を明示的に考慮しつつ、真比例航法を基盤にスライディングモード制御で時間制約付き迎撃を実現する。
原題: Bounded-Input True Proportional Navigation for Impact-Time Control / Lohitvel Gopikannan, Shashi Ranjan Kumar, Abhinav Sinha
日本語で読む → - 論文歩行ロボティクス
明示的な階段形状条件付けによる頑健な人型ロボット歩行
階段の高さ・奥行き・ヨー角などの明示的な幾何パラメータを歩行ポリシーに条件付けし、未見の階段形状への汎化と実機での頑健な昇段を実現した。
原題: Explicit Stair Geometry Conditioning for Robust Humanoid Locomotion / Jianguo Zhang, Wentai Xu, Shusheng Ye 他
日本語で読む → - 論文ロボットテストcs.SE
VISOR: ロボットテストのための視覚言語モデルベースのテストオラクル
ロボットのタスク実行の正しさと品質を自動評価する視覚言語モデルベースのテストオラクル手法を提案し、複数のロボットタスクで評価した。
原題: VISOR: A Vision-Language Model-based Test Oracle for Testing Robots / Prasun Saurabh, Pablo Valle, Aitor Arrieta 他
日本語で読む → - 論文参照解決ロボティクス
PoseRefer: 意味的接地参照解決のための経路局所パラメータ
VRインタラクションから自然な共発話ジェスチャを収集し、ポーズと言語を融合するアーキテクチャを提案。カテゴリ埋め込みの融合が単独のポーズやテキストより高い精度を達成。
原題: PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution / Anna Deichler
日本語で読む → - 論文自動運転画像認識
時間的サンプリング周波数の重要性:エンドツーエンド運転軌道予測の容量認識研究
エンドツーエンド自動運転の軌道予測において、カメラフレームの時間的サンプリング周波数を訓練データ設計の変数として扱い、モデル容量に応じて最適な周波数が異なることを示した研究。
原題: Temporal Sampling Frequency Matters: A Capacity-Aware Study of End-to-End Driving Trajectory Prediction / Yumao Liu, Tao Liu, Xiangyu Li 他
日本語で読む → - 論文群制御ロボティクス
PECMAN: 未知環境における知覚連携型マルチエージェントナビゲーション
未知環境でのマルチエージェントナビゲーションのために、分散型ツリーモーフィングと共有知覚戦略を用いたPECMANを提案し、シミュレーションと実機実験で有効性を示した。
原題: PECMAN: Perception-enabled Collaborative Multi-Agent Navigation in Unknown Environments / Tianchonghui Fang, Shaunak Roy, Shalabh Gupta
日本語で読む → - 論文VLA/ロボット制御ロボティクス
視覚言語行動モデルにおける非同期推論手法の理解
VLAモデルの推論遅延による観測の古さ問題を緩和する4つの手法(IT-RTC、TT-RTC、VLASH、A2C2)を統一的コードベースで比較し、各手法の特性と有効性を明らかにした。
原題: Understanding Asynchronous Inference Methods for Vision-Language-Action Models / Ayoub Agouzoul
日本語で読む → - 論文世界モデルロボティクス
Driver-WM: 運転者中心の交通条件付き潜在世界モデルによる車内ダイナミクスの展開
車外の交通状況に基づいて車内の運転者状態を予測する潜在世界モデルを提案し、運転者の行動・感情認識と物理的運動予測を統合した。
原題: Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout / Haozhuang Chi, Daosheng Qiu, Hao Su 他
日本語で読む → - 論文3D視覚グラウンディング画像認識
AgentGrounder: マルチモーダル言語モデルを用いたゼロショット3D視覚点群グラウンディング
色付き点群を直接入力とし、3D学習なしで自然言語による物体位置特定を行うゼロショット3D視覚グラウンディングフレームワークを提案。オフラインで物体テーブルを構築し、オンラインのツール駆動エージェントがクエリを分解して必要な候補だけを検索・評価する。
原題: AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models / Cuong Huynh, Maxim Popov, Denis Gridusov 他
日本語で読む → - 論文世界モデル画像認識
再構成か意味か?ロボット世界モデルに有用な潜在空間の条件
ロボットの行動条件付き拡散世界モデルにおいて、再構成用(VAE等)と意味用(V-JEPA等)の潜在空間を比較し、意味的潜在空間がポリシー性能や計画に優れることを示した。
原題: Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models / Nilaksh, Saurav Jha, Artem Zholus 他
日本語で読む → - 論文強化学習/ロコモーションロボティクス
ARC-RL: ARC Raidersに着想を得た強化学習プレイグラウンド
ゲームNPC向けの多様なロボット形態(ヘキサポッドや四足など)を備えたMuJoCo連続制御環境スイートを構築し、統一報酬関数とCPGデモを提供して、オンラインおよびオフラインからオンラインへの強化学習アルゴリズムを比較評価した。
原題: ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders / Carlo Romeo, Andrew D. Bagdanov
日本語で読む → - 論文点群処理ロボティクス
点群形状を統計多様体として学習する:理論と実践
点群の局所形状をガウス分布の統計多様体としてモデル化し、自己教師ありで各点のガウス形状を推定するニューラルネットワークPOLIを提案した。ラベルなしで高精度な形状推定を実現し、既存のロボット知覚パイプラインに容易に統合できる。
原題: Learning Point Cloud Geometry as a Statistical Manifold: Theory and Practice / Jinwoo Lee, Jiwoo Kim, Woojae Shin 他
日本語で読む → - 論文触覚/サーベイロボティクス
身体化知能における触覚ベースのマルチモーダル融合:視覚・言語・接触駆動パラダイムのサーベイ
触覚と視覚・言語を統合するマルチモーダル触覚融合の研究を包括的に調査し、データセットと手法の階層的分類法を提案した論文。
原題: Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms / Zhixiang Cao, Di Tian, Runwei Guan 他
日本語で読む → - 論文VLA画像認識
Evo-Depth: 軽量な深度強化型視覚言語行動モデル
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
原題: Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model / Tao Lin, Yuxin Du, Jiting Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
視覚と言語によるナビゲーションの限界は何か?
シミュレーションから実世界への展開で性能が低下するVLNエージェントの問題を解決するため、ステレオ視覚と目標位置の事前知識を用いたStereoNavを提案し、少ないパラメータとデータで最先端の性能を達成した。
原題: What Limits Vision-and-Language Navigation ? / Yunheng Wang, Yuetong Fang, Taowen Wang 他
日本語で読む → - 論文検証・再現性ロボティクス
再現可能なシミュレーションベースロボット検証のための来歴管理
ロボットのシミュレーションテストの再現性を高めるため、データの来歴(プロビナンス)とFAIR原則を統合し、既存のテストフレームワークに来歴追跡とメタデータ収集を追加して実証した論文。
原題: Replicable Simulation-Based Robot Validation through Provenance / Argentina Ortega, Samuel Wiest, Frederik Pasch 他
日本語で読む → - 論文移動ロボット制御ロボティクス
障害物密集環境における移動ロボットのためのリアクティブ計画に基づく制御
部分的な環境情報しか持たない移動ロボットが、障害物を回避しながら目標位置へ移動するための、リアクティブ計画と適応追従制御を組み合わせた制御戦略を提案した論文。
原題: Reactive Planning based Control for Mobile Robots in Obstacle-Cluttered Environments / Li Tan, Junlin Xiong, Yan Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
VE2VF: 実世界強化学習による視覚有効から視覚不要への蒸留による頑健な接触リッチ操作
実世界での人間参加型強化学習により、視覚を使う教師ポリシーから視覚を使わない学生ポリシーへ知識を蒸留し、接触を伴う操作タスクの頑健性と汎化を高める手法を提案した。
原題: VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation / Victor Kowalski, Chengxi Li, Dongheui Lee
日本語で読む → - 論文シミュレーション画像認識
RigidFormer: トランスフォーマーを用いた剛体力学の学習
メッシュフリーの点群入力から剛体の力学を学習するオブジェクト中心のトランスフォーマーモデルを提案し、アンカーとKabsch整列により剛性を保ちつつ高速で高精度なシミュレーションを実現した。
原題: RigidFormer: Learning Rigid Dynamics using Transformers / Zhiyang Dou, Minghao Guo, Haixu Wu 他
日本語で読む → - 論文群制御ロボティクス
異なる表面上でのマルチロボットによる箱の運搬:分散型役割ベース比例制御
複数ロボットが協調して箱を押して運搬するための分散型タスク・動作計画手法を提案し、斜面や摩擦の異なる環境での有効性をシミュレーションと実機で検証した。
原題: Multi-Robot Box Transport over Different Surfaces with Decentralized Role-based Proportional Control / Aditya Bhatt, Himavarshini Yarragangu, Urvish Shah 他
日本語で読む → - 論文強化学習/操作ロボティクス
ハイブリッド接触ダイナミクス下での物理情報を活用した目標条件付き強化学習
接触を伴う操作タスクで物理情報を活用した目標条件付き強化学習(Pi-GCRL)が劣化する問題を分析し、接触を考慮した階層的定式化を提案して性能を改善した。
原題: Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics / Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi
日本語で読む → - 論文状態推定ロボティクス
弦間スパース性を活用した因子グラフによる大域的最適推定
因子グラフでモデル化されたロボットの状態推定問題に対し、凸緩和を用いた大域的最適解を自動構築し、ベイズ木構造を利用してSDPを分解することで計算を高速化する手法を提案した。
原題: Exploiting Chordal Sparsity for Globally Optimal Estimation with Factor Graphs / Avinash Subramanian, Connor Holmes, Timothy D. Barfoot 他
日本語で読む → - 論文VLAロボティクス
Gaze2Act: 視線条件付き視覚言語行動ポリシーによる対話的ロボット操作
人間の視線を意図信号として活用し、ロボット操作の精度を高める新しいVLAフレームワークを提案した論文。
原題: Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation / Kuangji Zuo, Gen Li, Bofan Lyu 他
日本語で読む → - 論文ナビゲーションロボティクス
BAT-Nav: 長期セマンティックナビゲーションのための予算認識型調停と終了
限られた行動予算で複数の目標を探索する長期ナビゲーションにおいて、低収益な目標が予算を独占する問題を解決するため、凍結されたVLMベースのナビゲーションの上で動作する訓練不要のオンライン目標調停機構を提案した。
原題: BAT-Nav: Budget-Aware Arbitration and Termination for Long-Horizon Semantic Navigation / Xi Lin, Kangyi Wu, Jiayi Li 他
日本語で読む → - 論文3D再構成画像認識
IVGT: 暗黙的視覚幾何トランスフォーマーによるニューラルシーン表現
カメラポーズが未知の多視点画像から、連続的で一貫した3D幾何と外観を暗黙的にモデル化する手法を提案。SDFと色を予測する軽量デコーダを用いて、任意の3D位置での空間クエリを可能にし、メッシュ再構成や新規視点合成など多様なタスクで高い性能を示した。
原題: IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation / Yuqi Wu, Tianyu Hu, Wenzhao Zheng 他
日本語で読む → - 論文自動運転/VLA/ロバスト性cs.CR
ReasonBreak: 自動運転向け推論対応VLAモデルの脆弱性探査
自動運転用の推論機能付き視覚言語行動(VLA)モデルが、現実的な入力摂動に対して脆弱であることを示し、最大89%の推論攻撃成功率と72%の軌道操作成功率を報告した。
原題: ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving / Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit 他
日本語で読む → - 論文ハプティクス/リハビリテーションロボティクス
精密な力生成の学習を促進するための有形仮想オブジェクトのダイナミクス操作
脳卒中後のリハビリテーションにおける精密な力制御の訓練を改善するため、仮想バネの力-伸び関係を非線形(ガウス型や非対称ガウス型)に操作し、その効果を健康な被験者50名で検証した。
原題: Manipulating Tangible Virtual Object Dynamics to Promote Learning of Precision Force Generation / Alberto Garzás-Villar, Alba Riera-Cardona, Alexis Derumigny 他
日本語で読む →