論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ジェスチャ生成ロボティクス
ロボットの共話における感情を考慮した効率的な象徴的ジェスチャ予測
音声なしでテキストと感情から象徴的ジェスチャの位置と強度を予測する軽量トランスフォーマーを提案し、BEAT2データセットでGPT-4oを上回る性能を実証した。
原題: Efficient Emotion-Aware Iconic Gesture Prediction for Robot Co-Speech / Edwin C. Montiel-Vazquez, Christian Arzate Cruz, Stefanos Gkikas 他
日本語で読む → - 論文ビデオQA/自己中心視点画像認識
自己中心映像におけるパーソナライズ質問応答のための自我接地
自己中心映像中のカメラ装着者を理解する能力(自我接地)を評価する初のデータセットMyEgoを構築し、既存のマルチモーダル大規模言語モデルがこのタスクで人間に大きく劣ることを示した。
原題: Ego-Grounding for Personalized Question-Answering in Egocentric Videos / Junbin Xiao, Shenglang Zhang, Pengxiang Zhu 他
日本語で読む → - 論文マッピングロボティクス
D-BDM: LiDAR用の直接的で効率的な境界ベース占有グリッドマッピングフレームワーク
境界ベースの占有グリッドマップ更新を高速化するため、境界外のみを走査する打ち切りレイキャスティングと、補助グリッドを不要にする直接更新機構を提案した。
原題: D-BDM: A Direct and Efficient Boundary-Based Occupancy Grid Mapping Framework for LiDARs / Benxu Tang, Yixi Cai, Fanze Kong 他
日本語で読む → - 論文VLAロボティクス
ロックインの打破:低データVLA後訓練における操縦性の維持
低データでの後訓練後にVLAポリシーが新しい指示に応答しなくなる「ロックイン」現象を特定し、視覚的接地の維持とテスト時の対照的プロンプトガイダンスによりこれを緩和するDeLockを提案した。
原題: Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training / Suning Huang, Jiaqi Shao, Ke Wang 他
日本語で読む → - 論文自動運転/VLA画像認識
Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
原題: Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation / Jinghui Lu, Jiayi Guan, Zhijian Huang 他
日本語で読む → - 論文歩行/格闘/スキル遷移ロボティクス
RPG: 人間型格闘における複数スキル遷移のためのロバストなポリシーゲーティング
人間型ロボットの格闘動作において、複数のスキルを切り替える際の不安定さを解決するため、遷移ランダム化と時間ランダム化を用いたハイブリッド専門家ポリシーフレームワークを提案し、シミュレーションと実機で検証した。
原題: RPG: Robust Policy Gating for Smooth Multi-Skill Transitions in Humanoid Fighting / Yucheng Xin, Jiacheng Bao, Yubo Dong 他
日本語で読む → - 論文強化学習/ロバスト制御機械学習
動的不確実性下でのロバストな敵対的方策最適化
強化学習の方策が訓練時と異なる動的環境で失敗する問題に対し、双対問題に基づく温度パラメータを敵対的ネットワークで近似し、軌道レベルとモデルレベルの両方で敵対的サンプリングを行うロバストな方策最適化手法を提案した。
原題: Robust Adversarial Policy Optimization Under Dynamics Uncertainty / Mintae Kim, Koushil Sreenath
日本語で読む → - 論文マニピュレーションロボティクス
QDTraj:関節物体ロボット操作のための多様な軌道プリミティブの探索
本論文では、関節物体の操作タスクにおいて、Quality-Diversityアルゴリズムを用いて多様で高性能な軌道プリミティブを自動生成する手法QDTrajを提案し、シミュレーションと実世界で検証した。
原題: QDTraj: Exploration of Diverse Trajectory Primitives for Articulated Objects Robotic Manipulation / Mathilde Kappel, Mahdi Khoramshahi, Louis Annabi 他
日本語で読む → - 論文UAV制御ロボティクス
二重傾斜UAVプラットフォームのための動的制御配分
二重傾斜可能なヘキサローターUAVの軌道追従タスクにおいて、高レベルコントローラとアクチュエータの動的制御配分則を階層的に構成し、飽和を考慮して冗長性を活用する手法を提案した。
原題: Dynamic Control Allocation for Dual-Tilt UAV Platforms / Marcello Sorge, Federico Ciresola, Giulia Michieletto 他
日本語で読む → - 論文マニピュレーションロボティクス
F2F-AP: フローから未来への非同期ポリシーによるリアルタイム動的マニピュレーション
非同期推論の遅延問題を解決するため、物体のフロー予測を用いて未来の観測を合成し、視覚特徴を整合させることで、動的環境での操作を先読みして実行するフレームワークを提案した。
原題: F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation / Haoyu Wei, Xiuwei Xu, Ziyang Cheng 他
日本語で読む → - 論文VLA/ポストトレーニングロボティクス
Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
原題: Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training / Yaxuan Li, Zhongyi Zhou, Yefei Chen 他
日本語で読む → - 論文自動運転/リスク評価ロボティクス
運転リスクは二次元の回避加速度から生じる
衝突回避の二次元的性質を考慮した新しいリスク指標「回避加速度(EA)」を提案し、実データで従来のTTCより早期かつ高精度に衝突リスクを評価できることを示した論文。
原題: Driving risk emerges from the required two-dimensional joint evasive acceleration / Hao Cheng, Yanbo Jiang, Wenhao Yu 他
日本語で読む → - 論文群制御ロボティクス
動的屋内環境監視のためのマルチエージェント強化学習による協調的情報収集
複数ロボットが屋内の人間活動を監視する際、監視精度を直接最適化する協調制御をマルチエージェント強化学習で学習する手法を提案した。
原題: Cooperative Informative Sensing for Monitoring Dynamic Indoor Environments via Multi-Agent Reinforcement Learning / Kanghoon Lee, Matthew M. Sato, Jinnyeong Yang 他
日本語で読む → - 論文データセットロボティクス
場所カテゴリ分類のためのマルチモーダルパノラマ3D屋外データセット
森林、海岸、住宅地、都市部、駐車場などの場所カテゴリを分類するための、2種類のマルチモーダルなパノラマ3D屋外データセットを公開し、分類精度を比較した。
原題: Multi-modal panoramic 3D outdoor datasets for place categorization / Hojung Jung, Yuki Oto, Oscar M. Mozos 他
日本語で読む → - 論文把持ロボティクス
夢のように掴む:生成された人間デモから機能的把持を模倣する
ビデオ生成モデルなどの視覚生成モデルで合成した人間のデモを使って、ロボットの機能的把持をゼロショットで学習する手法GraspDreamerを提案。データ収集の手間を省きつつ、多様な物体・タスクへの汎化を実現した。
原題: Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations / Chao Tang, Jiacheng Xu, Haofei Lu 他
日本語で読む → - 論文機構解析ロボティクス
精密減速機の伝達特性を解析する動的ツールキット:接触形状を明示的に考慮した統一フレームワーク
ロボット用精密減速機の伝達特性を高精度・高速に解析する動的ツールキットを提案。接触理論と数値解法を統合し、剛性評価や振動予測を可能にする。
原題: A Dynamic Toolkit for Transmission Characteristics of Precision Reducers with Explicit Contact Geometry / Jiacheng Miao, Chao Liu, Qiliang Wang 他
日本語で読む → - 論文模倣学習ロボティクス
PD制御下の行動クローニング:ゲイン依存誤差増幅の有限時間理論
PD制御で動作するロボットの行動クローニングについて、制御ゲインが失敗確率にどう影響するかを有限時間で理論解析した論文。
原題: Behavior Cloning Under PD Control: A Finite-Horizon Theory of Gain-Dependent Error Amplification / Junghoon Seo
日本語で読む → - 論文状態推定ロボティクス
リー群上の自然勾配ガウス近似フィルタによるロボット状態推定
リー群上で定義された非線形観測モデルを線形化せずに、ガウス分布の増分変数に対する最適化問題として再定式化し、自然勾配法を用いて解く新しいフィルタリング手法を提案した。実機の脚ロボット実験で有効性を実証した。
原題: Natural Gradient Gaussian Approximation Filter on Lie Groups for Robot State Estimation / Tianyi Zhang, Wenhan Cao, Chang Liu 他
日本語で読む → - 論文マニピュレーションロボティクス
VistaBot: 時空間認識ビュー合成による視点ロバストなロボット操作
カメラ視点の変化にロバストなロボット操作を実現するため、幾何モデルとビデオ拡散モデルを統合したフレームワークVistaBotを提案。テスト時のカメラ校正不要で、シミュレーションと実世界で性能を検証した。
原題: VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis / Songen Gu, Yuhang Zheng, Weize Li 他
日本語で読む → - 論文経路計画ロボティクス
トレーラー牽引車両のハイブリッドA*に基づく後退経路計画
トレーラー牽引車両の後退駐車を、ジャックナイフ防止と衝突回避を考慮した改良ハイブリッドA*アルゴリズムで計画する手法を提案した。
原題: Hybrid A*-Based Reverse Path-Planning of a Vehicle with Trailer System / Xincheng Cao, Haochong Chen, Bilin Aksun-Guvenc 他
日本語で読む → - 論文制御/ニューラルMPC制御
全方位空中ロボットのニューラルMPCにおける残差力学学習のためのエネルギー正則化
ニューラルMPCで全方位空中ロボットの残差力学を学習する際、エネルギー正則化損失を導入し、実機実験で位置誤差を最大23%削減した。
原題: Energy-based Regularization for Learning Residual Dynamics in Neural MPC for Omnidirectional Aerial Robots / Johannes Kübel, Henrik Krauss, Jinjie Li 他
日本語で読む → - 論文フィールドマッピングロボティクス
ハフ変換を用いたガウス過程による安全性を考慮したスカラー場マッピング
センサ搭載ロボットが危険領域(高強度領域)を回避しながら未知のスカラー場を安全にマッピングする枠組みを提案。ガウス過程で場をモデル化し、ハフ変換で危険領域の構造を推定しつつ、確率的な安全性保証に基づくサンプリング戦略でロボットを誘導する。
原題: A Hough transform approach to safety-aware scalar field mapping using Gaussian Processes / Muzaffar Qureshi, Trivikram Satharasi, Tochukwu E. Ogri 他
日本語で読む → - 論文HRI/マルチエージェントロボティクス
M2HRI: LLM駆動のマルチモーダル・マルチエージェントフレームワークによるパーソナライズされた人機会話
各ロボットに個性と長期記憶を持たせ、文脈に応じた参加調整を行うマルチエージェントHRIフレームワークを提案し、ユーザー実験でその有効性を検証した。
原題: M2HRI: An LLM-Driven Multimodal Multi-Agent Framework for Personalized Human-Robot Interaction / Shaid Hasan, Breenice Lee, Sujan Sarker 他
日本語で読む → - 論文マニピュレーションロボティクス
トレース条件付きVLA計画による長期的操作
長期的な操作タスクを、タスク管理VLMが現在の観察から残りの計画を予測し、視覚的トレースを実行VLAに提供することで、短期的なVLA実行を長期的な指示追従に拡張するフレームワークを提案。
原題: Long-Horizon Manipulation via Trace-Conditioned VLA Planning / Isabella Liu, An-Chieh Cheng, Rui Yan 他
日本語で読む → - 論文制御合成ロボティクス
時間的振る舞い木の三値論理エンコーディングと制御合成への応用
振る舞い木の実行を三値信号時相論理で再定式化し、混合整数線形計画による制御合成を可能にした。
原題: Ternary Logic Encodings of Temporal Behavior Trees with Application to Control Synthesis / Ryan Matheu, John S. Baras, Calin Belta
日本語で読む → - 論文VLA画像認識
アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
原題: Action Images: End-to-End Policy Learning via Multiview Video Generation / Haoyu Zhen, Zixian Gao, Qiao Sun 他
日本語で読む → - 論文配送最適化ロボティクス
TriDeliver: UAV・配達員・クラウドソース地上車両による協調型即時配送
配達員、UAV、クラウドソース地上車両を階層的に統合した初の協調フレームワークを提案し、転移学習で配達知識を共有して即時配送の効率化を実証した。
原題: TriDeliver: Cooperative Air-Ground Instant Delivery with UAVs, Couriers, and Crowdsourced Ground Vehicles / Junhui Gao, Yan Pan, Qianru Wang 他
日本語で読む → - 論文ナビゲーション画像認識
FineCog-Nav: 細粒度認知モジュール統合によるゼロショットマルチモーダルUAVナビゲーション
人間の認知プロセスを模倣した細粒度モジュールを統合し、ゼロショットでUAVの視覚言語ナビゲーションを行うフレームワークを提案した論文。
原題: FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation / Dian Shao, Zhengzheng Xu, Peiyang Wang 他
日本語で読む → - 論文動作生成ロボティクス
CLAW: 構成可能な言語注釈付き全身動作生成
ヒューマノイドロボットのための言語条件付き全身動作データを大規模に生成するパイプラインを提案し、物理的に実行可能な軌道と多様な言語注釈を自動生成する。
原題: CLAW: Composable Language-Annotated Whole-body Motion Generation / Jianuo Cao, Yuxin Chen, Masayoshi Tomizuka
日本語で読む → - 論文異常検知/セグメンテーション画像認識
3D LiDAR異常セグメンテーションのための分布外物体識別学習
既知クラスの特徴分布をモデル化して異常サンプルを制約する、特徴空間で直接動作する新しい3D LiDAR異常セグメンテーション手法を提案し、実世界と合成データを組み合わせた新データセットも導入した。
原題: Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation / Simone Mosco, Daniel Fusaro, Alberto Pretto
日本語で読む →