論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
マインドドリーマー:潜在多様体への能動的因果介入による想像力の解放
モデルベース強化学習において、観測状態からではなく生成的初期状態から想像を開始することで、歴史的束縛を打破し、探索と報酬最適化の非対称性を解消する新しいフレームワークを提案した。
原題: Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds / Shaojun Xu, Xiaoling Zhou, Yihan Lin 他
日本語で読む → - 論文VLA/強化学習/人間介入ロボティクス
UniSteer: 人間のガイダンスを活用したVLA適応のための統合ノイズステアリング
拡散型VLAモデルの実世界適応を効率化するため、人間の修正行動をノイズ空間の強化学習に統合するフレームワークUniSteerを提案。実機実験で成功率を平均66分で20%から90%に向上させた。
原題: UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation / Junjie Lu, Xinyao Qin, Yuhua Jiang 他
日本語で読む → - 論文強化学習機械学習
適応的Qチャンキングによるオフラインからオンラインへの強化学習
オフラインからオンラインへの強化学習において、状態ごとに最適なアクションチャンクサイズを適応的に選択する手法を提案し、固定サイズの既存手法より高い成功率を達成した。
原題: Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning / Nandiraju Gireesh, Yuanliang Ju, He Wang
日本語で読む → - 論文安全強化学習ロボティクス
ロバストKoopman制御バリアフィルタによる安全なActor-Critic強化学習
データからKoopman予測器を学習し、リフト空間でCBF制約を構築して安全フィルタを実現する、安全な強化学習フレームワークを提案した。
原題: Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning / Dhruv S. Kushwaha, Zoleikha A. Biron
日本語で読む → - 論文強化学習/空中ロボットロボティクス
林冠下森林環境におけるRLベースのクアッドローター制御による空中点検行動
深層強化学習を用いたクアッドローターの低レベル制御ポリシーを提案し、林冠下の森林での点検視点追跡とナビゲーションを実現する。上位のTSP/RRT*プランナーと組み合わせて長距離ミッションを安全に実行する。
原題: Aerial Inspection Behaviors via RL-based Quadrotor Control for Under-canopy Forest Environments / Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy 他
日本語で読む → - 論文強化学習/操作ロボティクス
ハイブリッド接触ダイナミクス下での物理情報を活用した目標条件付き強化学習
接触を伴う操作タスクで物理情報を活用した目標条件付き強化学習(Pi-GCRL)が劣化する問題を分析し、接触を考慮した階層的定式化を提案して性能を改善した。
原題: Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics / Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi
日本語で読む → - 論文強化学習AI
RankQ: 自己教師ありアクションランキングによるオフラインからオンラインへの強化学習
オフラインからオンラインへの強化学習において、時間差学習に自己教師ありのランキング損失を追加し、アクションの相対的な好みを学習することで、価値関数の過大評価を抑えつつ、より高品質な行動への改善を促進する手法RankQを提案した。
原題: RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking / Andrew Choi, Wei Xu
日本語で読む → - 論文強化学習/システムアーキテクチャロボティクス
UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
原題: UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms / Yufei Jia, Zhanxiang Cao, Mingrui Yu 他
日本語で読む → - 論文強化学習機械学習
数分でレースを学習:Mini WheelbotにおけるInfoprop Dyna
実機のMini Wheelbot(一輪車ロボット)が、モデルベース強化学習フレームワークInfoprop Dynaを用いて、実世界でのインタラクションのみから11分でトラックを周回するレースを学習できることを実証した論文。
原題: Learning to Race in Minutes: Infoprop Dyna on the Mini Wheelbot / Devdutt Subhasish, Henrik Hose, Sebastian Trimpe
日本語で読む → - 論文強化学習/歩行ロボティクス
外部力誘導カリキュラム学習による動的運動の学習
スポッティングに着想を得た外部補助力を訓練中に導入し、報酬設計や参照軌道なしで動的全身体運動の学習を加速・可能にする手法を提案した。
原題: EFGCL: Learning Dynamic Motion through Spotting-Inspired External Force Guided Curriculum Learning / Keita Yoneda, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文強化学習機械学習
信頼領域Q-随伴マッチング
事前学習済みフローポリシーのオフポリシー強化学習を安定化するため、経路空間KLを信頼領域パラメータで制御するTRQAMを提案し、50のOGBenchタスクで既存手法を上回る性能を達成した。
原題: Trust Region Q Adjoint Matching / Yonghoon Dong, Kyungmin Lee, Changyeon Kim 他
日本語で読む → - 論文強化学習機械学習
適応チャンクサイズのアクタークリティックと因果トランスフォーマーQネットワーク
強化学習における長期的・疎報酬タスク向けに、チャンクサイズを状態に応じて適応的に選択するアクタークリティック法を提案し、オフラインおよびオフラインからオンラインへの設定で最先端性能を達成した。
原題: ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network / Qian Chen, Junqiao Zhao, Hongtu Zhou 他
日本語で読む → - 論文模倣学習/逆強化学習ロボティクス
拡散ベースのポリシーにおける隠れた報酬の回復
拡散モデルと逆強化学習を統合し、スコア関数が専門家のソフトQ関数の勾配を回復することを利用して、敵対的学習なしで報酬を抽出するフレームワークを提案した。
原題: Recovering Hidden Reward in Diffusion-Based Policies / Yanbiao Ji, Qiuchang Li, Yuting Hu 他
日本語で読む → - 論文強化学習/自動運転ロボティクス
安全フィルタリングを超えて:制御バリア関数を活用した連結自動運転車の強化学習
制御バリア関数(CBF)の制約値を報酬信号に変換し、マルチエージェント強化学習の安全性を高める手法を提案。交差点シナリオで既存手法より高い性能とロバスト性を示した。
原題: Beyond Safety Filtering: Control Barrier Function-Informed Reinforcement Learning for Connected and Automated Vehicles / Jianye Xu, Bassam Alrifaee
日本語で読む → - 論文自動運転/強化学習画像認識
MTA-RL: マルチモーダルトランスフォーマーによる3Dアフォーダンスと強化学習を用いた堅牢な都市運転
RGB画像とLiDAR点群をトランスフォーマーで融合し、幾何学的な3Dアフォーダンスを予測して強化学習の観測空間とすることで、解釈可能でサンプル効率の高い都市自動運転を実現した。CARLAシミュレーションでゼロショット汎化性能が向上することを示した。
原題: MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning / Guangli Chen, Dianzhao Li, Wenjian Zhong 他
日本語で読む → - 論文強化学習機械学習
エントロピー正則化に基づく近位方策最適化(ERPPO)
マルチエージェント強化学習における非定常な観測環境での方策最適化を改善するため、エントロピー正則化項を導入した新しいPPO手法を提案した。
原題: ERPPO: Entropy Regularization-based Proximal Policy Optimization / Changha Lee, Gyusang Cho
日本語で読む → - 論文VLA/強化学習ファインチューニングロボティクス
EXPO-FT: 視覚言語行動モデルのサンプル効率的強化学習ファインチューニング
事前学習済みの視覚言語行動(VLA)モデルを強化学習で安定かつサンプル効率的にファインチューニングするシステムEXPO-FTを提案し、高精度・動的動作を要する複数の操作タスクで完全成功率を達成した。
原題: EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models / Perry Dong, Kuo-Han Hung, Tian Gao 他
日本語で読む → - 論文マルチエージェント強化学習AI
調整には時としてランダム性が必要である
協調マルチエージェント強化学習において、対称な観測下で決定的方策が役割分化できない問題を、エージェントごとに乱数をサンプリングして順位付けし注意をマスクするDiamond Attentionで解決し、ゼロショット転移を実現した。
原題: Randomness is sometimes necessary for coordination / Rohan Patil, Jai Malegaonkar, Henrik I. Christensen
日本語で読む → - 論文強化学習機械学習
分位点結合フローマッチングによる分布強化学習
分布強化学習における条件付きフローマッチング批判器の損失がワッサーシュタイン距離と整合しない問題を解決するため、ソースとベルマン目標サンプルを分位点で整列させるFlowIQNを提案した。
原題: Quantile-Coupled Flow Matching for Distributional Reinforcement Learning / Michael Groom, Victor-Alexandru Darvariu, Lars Kunze 他
日本語で読む → - 論文マルチエージェント強化学習/自動運転機械学習
歩行者行動の不確実性下での安全な自動運転のためのマルチエージェント強化学習
自動運転車と歩行者をマルチエージェント強化学習で同時訓練し、現実的な横断行動を生成して安全性評価を向上させる手法を提案した。
原題: Multi-Agent Reinforcement Learning for Safe Autonomous Driving Under Pedestrian Behavioral Uncertainty / Prakash Aryan, Kaushik Raghupathruni, Timo Kehrer 他
日本語で読む → - 論文強化学習機械学習
EfficientTDMPC: サンプル効率的な連続制御のための改良MPC目的関数
TD-MPC系アルゴリズムを基に、モデルアンサンブルと不確実性ペナルティを導入し、データ鮮度向上と計算削減を加えることで、サンプル効率を大幅に改善したモデルベース強化学習手法を提案した。
原題: EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control / Thomas Evers, Cristian Meo, Wendelin Bohmer 他
日本語で読む → - 論文強化学習AI
D-VLA: 視覚言語行動モデルのための高並列分散非同期強化学習フレームワーク
大規模VLAモデルへの強化学習適用時のリソース競合を解決するため、物理分離と非同期パイプラインを備えた分散RLフレームワークD-VLAを提案し、スループットとサンプリング効率を大幅に向上させた。
原題: D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models / Yucheng Guo, Yongjian Guo, Zhong Guan 他
日本語で読む → - 論文強化学習機械学習
FLAG: 潜在拡張ガイダンスによるフローポリシーMaxEnt-RL
最大エントロピー強化学習において、重要度重みの崩壊を避けるためサンプリング領域を局所化し、フロー潜在変数で状態空間を拡張して代理目的を最適化する手法FLAGを提案。高次元制御タスクでSOTA性能を達成。
原題: FLAG: Flow Policy MaxEnt-RL by Latent Augmented Guidance / Sungha Kim, Gawon Lee, Jusuk Lee 他
日本語で読む → - 論文強化学習/転移学習ロボティクス
カスタムカーレース環境のための転移学習
深層強化学習において、あるサーキットで訓練したエージェントを別のカスタム環境に転移させ、ゼロショット転移や微調整で速いラップタイムを達成する手法を探求した。モデルベース手法がモデルフリー手法より性能と収束速度で優れることを示した。
原題: Transfer Learning for Customized Car Racing Environments / Benedict Florance Arockiaraj, Richard Chang, Wesley Yee
日本語で読む → - 論文強化学習/着陸ロボティクス
荒れた海面への視覚に基づく機敏な着陸
強化学習を用いて、移動する海上プラットフォームへのマルチローターの自律着陸を、プラットフォームの状態推定なしで視覚特徴のみから実現する手法を提案した。
原題: Vision-Based Agile Landing on Turbulent Waters / Dimosthenis Angelis, Leonard Bauersfeld, Davide Scaramuzza 他
日本語で読む → - 論文強化学習/制御ロボティクス
強化学習によるクアッドローターの適応型アウターループ制御
クアッドローターの飛行制御に強化学習を適用し、外乱を推定する残差ダイナミクス予測器と実機転送のための校正機構を導入して、動的擾乱下でも高精度な軌道追従を実現した。
原題: Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning / Vishnu Saj, Sushil Vemuri, Dileep Kalathil 他
日本語で読む → - 論文強化学習ロボティクス
照明変化に頑健な人間参加型ロボット強化学習
照明変化による視覚分布のずれで性能が落ちる問題に対し、追加の実ロボット操作なしで、画像の再照明と忘却防止機構を組み合わせたオフライン微調整フレームワークRoHILを提案した。
原題: RoHIL: Robust Human-in-the-Loop Robotic Reinforcement Learning Against Illumination Variations / Shuoqin Zhang, Yixin Xiong, Xiru Gao 他
日本語で読む → - 論文強化学習/航行ロボティクス
信頼・幾何・規則:不確実性下での安全なUSV航行のための信頼性認識強化学習フレームワーク
無人水上艇(USV)の安全でCOLREG準拠の自律航行を実現するため、信頼性重み付き価値学習、共分散膨張速度障害物、リスク認識COLREG義務埋め込みを統合した強化学習フレームワークを提案した。
原題: Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty / Yuhang Zhang, Shuqi Chai, Yukang Zhang 他
日本語で読む → - 論文強化学習ロボティクス
階層的マクロ行動量子化による強化学習エージェントの人間らしさ向上
人間のデモンストレーションを階層的なベクトル量子化でマクロ行動に符号化し、報酬を最大化しつつ人間らしい行動系列を予測する強化学習フレームワークHiMAQを提案した。
原題: Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization / Usman Nizamani, M. Shaheer Luqman, Fawad Javed Fateh 他
日本語で読む → - 論文VLA/強化学習/巧緻操作ロボティクス
BORA: オフライン強化学習とオンライン残差適応を橋渡しする実世界巧緻操作VLAモデル
実世界の巧緻操作向けに、オフライン学習で価値関数を構築し、オンラインで人間介入による残差適応を行うVLAモデルの後訓練フレームワークを提案した。
原題: BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models / Zhongxi Chen, Yifan Han, Yanming Shao 他
日本語で読む →