論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習ロボティクス
ReinFlow: フローマッチング方策をオンライン強化学習で微調整
フローマッチング方策に学習可能なノイズを注入して離散マルコフ過程に変換し、オンライン強化学習で微調整する手法を提案。歩行・操作タスクで大幅な性能向上と計算時間削減を実現。
原題: ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning / Tonghe Zhang, Chao Yu, Sichang Su 他
日本語で読む → - 論文安全強化学習ロボティクス
ガードレールに導かれて:ロボット学習の安全インストラクターとしての制御バリア関数
安全行動の時間的影響を連続的な負の報酬でモデル化し、制御バリア関数(CBF)を強化学習に統合する3つの手法を提案。シミュレーションと実機の四輪差動駆動ロボットで、CBFが危険領域回避と学習改善に有効であることを示した。
原題: Guided by Guardrails: Control Barrier Functions as Safety Instructors for Robotic Learning / Maeva Guerrier, Karthik Soma, Hassan Fouad 他
日本語で読む → - 論文耐故障制御/強化学習ロボティクス
オンラインTransformer適応を組み込んだ強化学習によるクアッドロータの耐故障制御
Transformerでリアルタイムに潜在表現を推定し、未知の機体モデルにも再学習なしで適応できる強化学習ベースの耐故障制御フレームワークを提案し、アクチュエータ故障下で95%の成功率を達成した。
原題: Reinforcement Learning-based Fault-Tolerant Control for Quadrotor with Online Transformer Adaptation / Dohyun Kim, Jayden Dongwoo Lee, Hyochoong Bang 他
日本語で読む → - 論文強化学習ロボティクス
大規模言語モデルによるロボットスキル学習のための自動ハイブリッド報酬スケジューリング
LLMがタスク記述から報酬の重み付けルールを生成・選択し、複数の報酬成分を段階的に学習させることで、ロボットの強化学習スキル獲得を効率化するフレームワークを提案した。
原題: Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning / Changxin Huang, Junyang Liang, Yanbin Chang 他
日本語で読む → - 論文強化学習機械学習
価値推定の改善がバニラ方策勾配法を大幅に強化する
各反復での価値更新ステップ数を増やすだけで、バニラ方策勾配法がPPOと同等以上の性能を達成し、ハイパーパラメータにも頑健になることを示した。
原題: Improving Value Estimation Critically Enhances Vanilla Policy Gradient / Tao Wang, Ruipeng Zhang, Sicun Gao
日本語で読む → - 論文強化学習機械学習
DISCOVER: スパース報酬強化学習のための自動カリキュラム
目標タスクの方向へ探索目標を自動選択することで、スパース報酬の長期的タスクを効率的に解く強化学習手法を提案。
原題: DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning / Leander Diaz-Bone, Marco Bagatella, Jonas Hübotter 他
日本語で読む → - 論文強化学習ロボティクス
平均報酬最大エントロピー強化学習による二重振り子タスクのグローバル方策
アクロボットとペンドボットの振り上げ・安定化タスクに対し、平均報酬エントロピーアドバンテージ方策最適化(AR-EAPO)を改良して適用し、ICRA 2025のAIオリンピック新規定に対応した制御器を提案した。
原題: Average-Reward Maximum Entropy Reinforcement Learning for Global Policy in Double Pendulum Tasks / Jean Seong Bjorn Choe, Bumkyu Choi, Jong-kook Kim
日本語で読む → - 論文音響知覚/強化学習ロボティクス
非線形音響計算と強化学習を統合した実世界ヒューマンロボットインタラクションの枠組み
非線形音響モデルを強化学習の制御ループに組み込み、雑音や残響下での音源定位・音声認識を高精度化する手法を提案した。
原題: A Synergistic Framework of Nonlinear Acoustic Computing and Reinforcement Learning for Real-World Human-Robot Interaction / Xiaoliang Chen, Xin Yu, Le Chang 他
日本語で読む → - 論文安全強化学習ロボティクス
ログサムエックス近似CBFの閉形式解による複数制約安全強化学習
複数の安全制約を単一の合成CBFで連続的に近似し、二次計画問題の閉形式解を導出することで、微分可能最適化を不要にした安全強化学習手法を提案する。
原題: Multi-Constraint Safe Reinforcement Learning via Closed-form Solution for Log-Sum-Exp Approximation of Control Barrier Functions / Chenggang Wang, Xinyi Wang, Yutong Dong 他
日本語で読む → - 論文強化学習ロボティクス
深層強化学習における効率的なロボット操作のための時間反転対称性
ロボット操作タスクに潜む時間反転対称性を利用し、軌道反転によるデータ拡張と報酬整形を組み合わせて、深層強化学習のサンプル効率と性能を向上させるフレームワークTR-DRLを提案した。
原題: Time Reversal Symmetry for Efficient Robotic Manipulations in Deep Reinforcement Learning / Yunpeng Jiang, Jianshu Hu, Paul Weng 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
進歩と安全の両立:自動運転の強化学習におけるリスク認識型報酬設計
自動運転の強化学習において、衝突前のリスクを考慮した二次元楕円体関数とRSS拡張に基づく新しいリスク認識型報酬を提案し、無信号交差点で衝突率を21%削減しつつ経路進捗も改善した。
原題: Balancing Progress and Safety: A Novel Risk-Aware Objective for RL in Autonomous Driving / Ahmed Abouelazm, Jonas Michel, Helen Gremmelmaier 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
選好に応じて運転スタイルを動的に適応させる多目的強化学習による自動運転
多目的強化学習を用いて、効率・快適性・速度・攻撃性などの運転スタイル選好を連続的な重みベクトルで表現し、再学習なしに実行時に適応できる単一ポリシーの自動運転エージェントを提案した。CARLAシミュレータでの評価により、衝突回避や経路完走性能を維持しつつ選好に応じて動的に運転行動を変化させることを示した。
原題: Multi-Objective Reinforcement Learning for Adaptable Personalized Autonomous Driving / Hendrik Surmann, Jorge de Heuvel, Maren Bennewitz
日本語で読む → - 論文強化学習機械学習
サブゴール方策のブートストラップによる階層構造の平坦化
サブゴール条件付き方策をアドバンテージ重み付き重点サンプリングでブートストラップし、生成モデル不要で長地平のフラットな目標条件付き方策をオフライン学習する手法を提案。
原題: Flattening Hierarchies with Policy Bootstrapping / John L. Zhou, Jonathan C. Kao
日本語で読む → - 論文強化学習機械学習
形式的な目標到達保証を備えた汎用ポリシーラッパー
強化学習エージェントに形式的な目標到達保証を付与する汎用ラッパーを提案。高性能なベースポリシーと収束保証のあるフォールバックポリシーを切り替え、安全性と性能を両立する。
原題: A universal policy wrapper with guarantees / Anton Bolychev, Georgiy Malaniya, Grigory Yaremenko 他
日本語で読む → - 論文安全強化学習制御
確率線形システム制御のためのリスク対応型安全強化学習
確率離散時間線形システムに対し、リスクを考慮した安全な強化学習制御を提案。安全保証器による介入ではなく、安全制御器も学習しRL制御器と組み合わせることで、高信頼な安全性と効率的な計算を両立する。
原題: Risk-Aware Safe Reinforcement Learning for Control of Stochastic Linear Systems / Babak Esmaeili, Nariman Niknejad, Hamidreza Modares
日本語で読む → - 論文模倣学習/強化学習ロボティクス
IN-RIL: 模倣学習と強化学習を交互に組み合わせた方策ファインチューニング
強化学習の更新の合間に模倣学習の更新を定期的に挿入し、勾配を直交部分空間に分離することで、ファインチューニングの安定性とサンプル効率を向上させる手法を提案した。
原題: IN-RIL: Interleaved Reinforcement and Imitation Learning for Policy Fine-Tuning / Dechen Gao, Hang Wang, Hanchu Zhou 他
日本語で読む → - 論文階層型強化学習AI
MRS: 階層型強化学習エージェントのためのマルチ解像度スキル
階層型強化学習において、複数の時間スケールに特化した目標予測モジュールを学習し、状態に応じてメタコントローラが選択することで、敏捷性が必要なタスクの性能を向上させる手法を提案。
原題: MRS: Multi-Resolution Skills for HRL Agents / Shashank Sharma, Janina Hoffmann, Vinay Namboodiri
日本語で読む → - 論文強化学習機械学習
予測可能で堅牢な制御のための軌道エントロピー強化学習
行動軌道全体のエントロピーを最小化する新たな帰納バイアスを導入し、変分予測モデルで推定することで、周期性が高くノイズや環境変化に強い方策を学習する手法を提案した。
原題: Trajectory Entropy Reinforcement Learning for Predictable and Robust Control / Bang You, Chenxu Wang, Huaping Liu
日本語で読む → - 論文逆強化学習機械学習
最小限の観測による逆強化学習を用いたコスト関数推定
最大エントロピー基準に基づく反復的な逆強化学習アルゴリズムを提案し、少ない観測から連続空間における最適なコスト関数を効率的に推定する。
原題: Cost Function Estimation Using Inverse Reinforcement Learning with Minimal Observations / Sarmad Mehrdad, Avadesh Meduri, Ludovic Righetti
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
四足歩行ロボットチームによる実世界での協調・競争サッカーに向けて
階層型マルチエージェント強化学習により、四足歩行ロボットが自律的に協調・競争サッカーを行うフレームワークを提案し、実機でロボット同士や人間との試合を実現した。
原題: Toward Real-World Cooperative and Competitive Soccer with Quadrupedal Robot Teams / Zhi Su, Yuman Gao, Emily Lukas 他
日本語で読む → - 論文強化学習/ロバスト性/自律表面車両ロボティクス
実環境試験における自律表面車両制御のための深層強化学習のロバスト性評価
浮遊ゴミ回収用の深層強化学習エージェントをドメインランダム化で訓練し、非対称抗力や偏心ペイロードなどの外乱下での実環境性能をMPCと比較評価した。
原題: Evaluating Robustness of Deep Reinforcement Learning for Autonomous Surface Vehicle Control in Field Tests / Luis F. W. Batista, Stéphanie Aravecchia, Seth Hutchinson 他
日本語で読む → - 論文制御/強化学習ロボティクス
羽ばたきドローンのハイブリッド制御のための強化学習トウィニング
適応デジタルツインと強化学習を組み合わせ、実環境と仮想環境間で知識を転移しながら羽ばたきドローンの飛行制御を行うハイブリッド手法を提案。
原題: Reinforcement Twinning for Hybrid Control of Flapping-Wing Drones / Romain Poletti, Lorenzo Schena, Lilla Koloszar 他
日本語で読む → - 論文強化学習機械学習
オフライン事前学習済み方策のみを用いた効率的なオンラインRLファインチューニング
事前学習済みQ関数に頼らず、オフラインで学習した方策だけを使ってオンライン強化学習でファインチューニングする手法PORLを提案し、BC方策の直接改善も可能にした。
原題: Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only / Wei Xiao, Jiacheng Liu, Zifeng Zhuang 他
日本語で読む → - 論文ロバスト強化学習機械学習
線形混合分布ロバストマルコフ決定過程
遷移が線形混合モデルで表される場合に、混合重みの不確かさを考慮した新しい分布ロバストMDPを提案し、方策学習のサンプル複雑度を理論的に解析した。
原題: Linear Mixture Distributionally Robust Markov Decision Processes / Zhishuai Liu, Pan Xu
日本語で読む → - 論文自動運転/強化学習/LLMロボティクス
HCRMP:LLMヒント付き文脈強化学習による自動運転フレームワーク
LLMの幻覚に依存しすぎる従来手法を改善するため、LLMを意味的ヒント生成に限定しRLと相対的に独立させる新パラダイムを提案し、CARLAで検証した。
原題: HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving / Zhiwen Chen, Bo Leng, Zhuoren Li 他
日本語で読む → - 論文オフライン強化学習機械学習
時間距離を考慮した遷移拡張によるオフライン・モデルベース強化学習
オフライン強化学習において、生の状態空間ではなく時間的に構造化された潜在空間で遷移を拡張するTempDATAを提案し、スパース報酬の長期的タスクで従来手法を上回る性能を達成した。
原題: Temporal Distance-aware Transition Augmentation for Offline Model-based Reinforcement Learning / Dongsu Lee, Minhae Kwon
日本語で読む → - 論文強化学習/自律走行ロボティクス
速く走り、速く学ぶ:高性能自律レースのためのオンボード強化学習
シミュレーション事前学習に頼らず、実機上で直接学習する強化学習フレームワークを提案し、F1TENTHで20分の学習でラップタイムを最大11.5%短縮した。
原題: Drive Fast, Learn Faster: On-Board RL for High Performance Autonomous Racing / Benedict Hildisch, Edoardo Ghignone, Nicolas Baumann 他
日本語で読む → - 論文軌道計画/強化学習ロボティクス
SafeMove-RL: 動的運動制約下での軌道計画のための検証可能な強化学習フレームワーク
動的で不確実な環境での局所運動計画のため、動的安全マージンと適応的ギャップ分析を組み込んだ強化学習フレームワークを提案し、シミュレーションと実機で有効性を検証した。
原題: SafeMove-RL: A Certifiable Reinforcement Learning Framework for Dynamic Motion Constraints in Trajectory Planning / Tengfei Liu, Haoyang Zhong, Jiazheng Hu 他
日本語で読む → - 論文強化学習ロボティクス
DAPPER: 識別性を考慮したポリシー間選好ベース強化学習によるクエリ効率の良いロボットスキル獲得
複数のポリシー間の軌道比較で選好クエリを生成し、識別性を推定する識別器で優先サンプリングすることで、クエリ効率を高める選好ベース強化学習手法を提案。
原題: DAPPER: Discriminability-Aware Policy-to-Policy Preference-Based Reinforcement Learning for Query-Efficient Robot Skill Acquisition / Yuki Kadokawa, Jonas Frey, Takahiro Miki 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
自動カリキュラム学習による運転シナリオ生成:堅牢で効率的な強化学習に向けて
エージェントの能力に応じて難易度を自動調整する運転シナリオを生成するカリキュラム学習フレームワークを提案し、強化学習による自動運転エージェントの汎化性能と訓練効率を向上させた。
原題: Automatic Curriculum Learning for Driving Scenarios: Towards Robust and Efficient Reinforcement Learning / Ahmed Abouelazm, Tim Weinstein, Tim Joseph 他
日本語で読む →