論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/強化学習ロボティクス
自動カリキュラム学習による運転シナリオ生成:堅牢で効率的な強化学習に向けて
エージェントの能力に応じて難易度を自動調整する運転シナリオを生成するカリキュラム学習フレームワークを提案し、強化学習による自動運転エージェントの汎化性能と訓練効率を向上させた。
原題: Automatic Curriculum Learning for Driving Scenarios: Towards Robust and Efficient Reinforcement Learning / Ahmed Abouelazm, Tim Weinstein, Tim Joseph 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
四足歩行ロボットチームによる実世界での協調・競争サッカーに向けて
階層型マルチエージェント強化学習により、四足歩行ロボットが自律的に協調・競争サッカーを行うフレームワークを提案し、実機でロボット同士や人間との試合を実現した。
原題: Toward Real-World Cooperative and Competitive Soccer with Quadrupedal Robot Teams / Zhi Su, Yuman Gao, Emily Lukas 他
日本語で読む → - 論文強化学習機械学習
予測可能で堅牢な制御のための軌道エントロピー強化学習
行動軌道全体のエントロピーを最小化する新たな帰納バイアスを導入し、変分予測モデルで推定することで、周期性が高くノイズや環境変化に強い方策を学習する手法を提案した。
原題: Trajectory Entropy Reinforcement Learning for Predictable and Robust Control / Bang You, Chenxu Wang, Huaping Liu
日本語で読む → - 論文強化学習機械学習
ロバスト制約付きMDPにおける反復計算量保証付き効率的方策最適化
実モデルとシミュレータのずれがある状況で、最悪ケースのモデルに対しても制約を満たしつつ報酬を最大化する方策を、二分探索なしでO(ε^-2)反復で学習する手法を提案した論文。
原題: Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees / Sourav Ganguly, Kishan Panaganti, Arnob Ghosh 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
進歩と安全の両立:自動運転の強化学習におけるリスク認識型報酬設計
自動運転の強化学習において、衝突前のリスクを考慮した二次元楕円体関数とRSS拡張に基づく新しいリスク認識型報酬を提案し、無信号交差点で衝突率を21%削減しつつ経路進捗も改善した。
原題: Balancing Progress and Safety: A Novel Risk-Aware Objective for RL in Autonomous Driving / Ahmed Abouelazm, Jonas Michel, Helen Gremmelmaier 他
日本語で読む → - 論文強化学習機械学習
価値推定の改善がバニラ方策勾配法を大幅に強化する
各反復での価値更新ステップ数を増やすだけで、バニラ方策勾配法がPPOと同等以上の性能を達成し、ハイパーパラメータにも頑健になることを示した。
原題: Improving Value Estimation Critically Enhances Vanilla Policy Gradient / Tao Wang, Ruipeng Zhang, Sicun Gao
日本語で読む → - 論文強化学習機械学習
動的行動補間:専門家ガイダンスで強化学習を加速する汎用アプローチ
専門家と強化学習の行動を時間変化する重みで補間するだけで、Actor-Criticアルゴリズムのサンプル効率を大幅に改善する手法を提案。
原題: Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance / Wenjun Cao
日本語で読む → - 論文強化学習/協働ロボットロボティクス
人間に配慮した制御器:筋骨格系障害に関連する制約への強化学習による適応
強化学習(Q学習とDQN)を用いて協働ロボットの人間に配慮した制御戦略を開発し、筋骨格系障害歴のある作業者の痛みリスクをゼロに保ちつつ作業時間を短縮できることを示した。
原題: A Human-Sensitive Controller: Adapting to Human Musculoskeletal Disorder-Related Constraints via Reinforcement Learning / Vitor Martins, Sara M. Cerqueira, Mercedes Balcells 他
日本語で読む → - 論文強化学習/マルチタスクcs.NE
適応的タスク切替ポリシーを備えたスパイキングニューラルネットワークによるスケーラブルなマルチタスク学習
スパイキングニューラルネットワークと適応的タスク切替ポリシーを組み合わせ、タスク干渉を抑えつつ複数タスクを効率的に学習する手法SwitchMTを提案した。
原題: Scalable Multi-Task Learning through Spiking Neural Networks with Adaptive Task-Switching Policy for Intelligent Autonomous Agents / Rachmad Vidya Wicaksana Putra, Avaneesh Devkota, Muhammad Shafique
日本語で読む → - 論文強化学習報酬設計画像認識
GROVE: オープン語彙の身体スキルを学習するための汎用報酬
LLMとVLMを組み合わせて報酬を自動生成し、手設計や実演なしで多様な身体スキルを学習できる汎用報酬フレームワークを提案。
原題: GROVE: A Generalized Reward for Learning Open-Vocabulary Physical Skill / Jieming Cui, Tengyu Liu, Ziyu Meng 他
日本語で読む → - 論文強化学習/安全制御機械学習
適応型制御Lyapunov関数による強化学習の安定性向上
安全制約を動的に調整する制御Lyapunov関数を組み込んだSAC-CLFを提案し、非線形システムや衛星姿勢制御で安全性と性能の両立を実現した。
原題: Stability Enhancement in Reinforcement Learning via Adaptive Control Lyapunov Function / Donghe Chen, Han Wang, Lin Cheng 他
日本語で読む → - 論文自動運転/モデル予測制御/逆強化学習ロボティクス
逆強化学習によるシーン動力学学習を用いた自動運転車の非線形予測制御
距離センサの時系列からシーン動力学モデルを深層学習し、逆強化学習で目標軌道を推定して非線形モデル予測制御に組み込む自動運転手法を提案し、屋内・屋外・実車で評価した。
原題: Inverse RL Scene Dynamics Learning for Nonlinear Predictive Control in Autonomous Vehicles / Sorin Grigorescu, Mihai Zaha
日本語で読む → - 論文モデルベース強化学習ロボティクス
モデルベース強化学習による劣駆動システムの大域制御学習
MC-PILCOというモデルベース強化学習手法を用いて、ペンダボットとアクロボットの大域的な制御方策を学習し、RealAIGym競技会での優位性を示した論文。
原題: Learning global control of underactuated systems with Model-Based Reinforcement Learning / Niccolò Turcato, Marco Calì, Alberto Dalla Libera 他
日本語で読む → - 論文自動運転/強化学習/計画機械学習
CaRL: 単純な報酬でスケーラブルな計画ポリシーを学習する
自動運転の計画タスクにおいて、経路完了という単一の直感的な報酬を主に最適化する新しい報酬設計を提案し、PPOを大規模ミニバッチで効率的にスケールさせることで、CARLAとnuPlanで優れた性能を達成した。
原題: CaRL: Learning Scalable Planning Policies with Simple Rewards / Bernhard Jaeger, Daniel Dauner, Jens Beißwenger 他
日本語で読む → - 論文オフライン強化学習機械学習
非専門家デモを超えて:オフライン強化学習のための結果駆動型行動制約
非専門家による質の低いデモデータでも安全に学習できるよう、行動の生起確率ではなく結果が安全領域に収まるかで評価する新しい保守的報酬機構ODAFを提案し、MuJoCoや迷路タスクで有効性を示した論文。
原題: Beyond Non-Expert Demonstrations: Outcome-Driven Action Constraint for Offline Reinforcement Learning / Ke Jiang, Wen Jiang, Yao Li 他
日本語で読む → - 論文強化学習機械学習
行動基盤モデルの高速適応
事前学習済み行動基盤モデルのゼロショット方策を、低次元タスク埋め込み空間での探索によりオンライン数ステップで高速適応させる手法を提案。
原題: Fast Adaptation with Behavioral Foundation Models / Harshit Sikchi, Andrea Tirinzoni, Ahmed Touati 他
日本語で読む → - 論文オフライン強化学習ロボティクス
不確実性を考慮したロボット世界モデルによる実機オフライン強化学習の実現
自己回帰型世界モデルに認識的不確実性推定を組み込み、長期ロールアウトでの誤差蓄積を抑えることで、実機ロボットのオフラインデータのみからマニピュレーションや歩行タスクの制御方策を学習可能にした。
原題: Uncertainty-Aware Robotic World Model Makes Offline Model-Based Reinforcement Learning Work on Real Robots / Chenhao Li, Andreas Krause, Marco Hutter
日本語で読む → - 論文強化学習/自動運転ロボティクス
強化学習によるレーシングポリシーの学習
強化学習を用いて自動運転レースのポリシーを学習し、ドメインランダム化やアクチュエータ動力学モデル化により実機でゼロショット展開を実現。F1TENTHでMPCを上回り、RCレースで人間の専門ドライバーを超えた初の事例。
原題: On learning racing policies with reinforcement learning / Grzegorz Czechmanowski, Jan Węgrzynowski, Piotr Kicki 他
日本語で読む → - 論文強化学習/ケーブル駆動ロボットロボティクス
CaRoSaC: ケーブル弛みを考慮したケーブル駆動パラレルロボットの強化学習による運動制御
ケーブルの弛みを再現するシミュレータを構築し、モデルフリー強化学習でケーブル駆動パラレルロボットの運動制御を学習させ、従来の運動学手法より高精度な制御を実現した。
原題: CaRoSaC: A Reinforcement Learning-Based Kinematic Control of Cable-Driven Parallel Robots by Addressing Cable Sag through Simulation / Rohit Dhakate, Thomas Jantos, Eren Allak 他
日本語で読む → - 論文Human-in-the-Loop強化学習AI
実世界のHuman-in-the-Loop深層強化学習を設計するための体系的手法:顕著な特徴、課題、トレードオフ
人間の入力(報酬・行動・実演)を統合した多層階層型HITL強化学習アルゴリズムを提案し、敵ドローン迎撃UAV問題で有効性を検証した。
原題: A Systematic Approach to Design Real-World Human-in-the-Loop Deep Reinforcement Learning: Salient Features, Challenges and Trade-offs / Jalal Arabneydi, Saiful Islam, Srijita Das 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
視覚入力によるレースカー自動運転エージェント
深層強化学習(PPO)を用い、視覚情報のみからレースカーのステアリングとペダルを操作し、タイヤグリップ限界での走行を実現するエージェントを訓練した。
原題: Vision based driving agent for race car simulation environments / Gergely Bári, László Palkovics
日本語で読む → - 論文安全強化学習ロボティクス
マルチエージェント安全臨界シナリオの意思決定のための動的残差安全強化学習
弱から強への理論をマルチエージェント意思決定に初導入し、動的残差安全強化学習フレームワークで衝突率を最大92.17%削減した研究。
原題: Dynamic Residual Safe Reinforcement Learning for Multi-Agent Safety-Critical Scenarios Decision-Making / Kaifeng Wang, Yinsong Chen, Qi Liu 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
MARFT: マルチエージェント強化学習ファインチューニング
LLMベースのマルチエージェントシステムを強化学習でファインチューニングするための新しい定式化とフレームワークを提案し、従来のマルチエージェント強化学習との違いを分析した。
原題: MARFT: Multi-Agent Reinforcement Fine-Tuning / Junwei Liao, Muning Wen, Jun Wang 他
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習のためのクリーンな基盤
オフライン強化学習の曖昧な定義と複雑な実装を整理し、統一アルゴリズムUnifloralと厳密な評価プロトコルを提案。これによりTD3-AWRとMoBRACという新手法を開発し、既存手法を大幅に上回る性能を達成した。
原題: A Clean Slate for Offline Reinforcement Learning / Matthew Thomas Jackson, Uljad Berdica, Jarek Liesen 他
日本語で読む → - 論文強化学習ロボティクス
LAPP: 大規模言語モデルフィードバックによる選好駆動型強化学習
LLMを使って強化学習中の軌道から自動で選好ラベルを生成し、オンライン選好予測器を訓練することで、人間の手間を最小限に抑えつつ複雑なロボット行動を獲得するフレームワーク。
原題: LAPP: Large Language Model Feedback for Preference-Driven Reinforcement Learning / Pingcheng Jian, Xiao Wei, Yanbaihui Liu 他
日本語で読む → - 論文UAV/強化学習AI
協調型航空モビリティ制御のための幻覚対応生成事前学習トランスフォーマー
GPTと強化学習を組み合わせ、安全フィルタで幻覚を抑えつつUAVのラストマイル配送を効率化するSafeGPTを提案した論文。
原題: Hallucination-Aware Generative Pretrained Transformer for Cooperative Aerial Mobility Control / Hyojun Ahn, Seungcheol Oh, Gyu Seon Kim 他
日本語で読む → - 論文飛行制御/強化学習ロボティクス
大きな外乱を受けるUASのRLに基づく制御
外乱のトリガー信号を観測に取り込み、外乱が発生する前に予測的に対処する強化学習ベースのUAS位置・姿勢制御フレームワークを提案し、予測ポリシーが位置偏差を最小化することを示した。
原題: RL-based Control of UAS Subject to Significant Disturbance / Kousheek Chakraborty, Thijs Hof, Ayham Alharbat 他
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
ヒステリシスを考慮したニューラルネットワークモデリングと全身強化学習によるソフトロボット制御
軟質材料のヒステリシスを考慮した全身NNモデルを構築し、強化学習で全身制御方策を学習。ファントム実験で高精度な軌道追従を実現した。
原題: Hysteresis-Aware Neural Network Modeling and Whole-Body Reinforcement Learning Control of Soft Robots / Zongyuan Chen, Yan Xia, Jiayuan Liu 他
日本語で読む → - 論文安全強化学習/ナビゲーションAI
確率的列挙による制御バリア関数設計:安全な強化学習ナビゲーション
確率的列挙で危険領域を特定し、制御バリア関数に基づく安全層を構築することで、任意の強化学習ナビゲーション方策を安全に補正する階層制御フレームワークを提案した。
原題: Designing Control Barrier Function via Probabilistic Enumeration for Safe Reinforcement Learning Navigation / Luca Marzari, Francesco Trotti, Enrico Marchesini 他
日本語で読む → - 論文オフライン強化学習/自動運転ロボティクス
遮蔽された横断歩道における自動緊急ブレーキのための人間整合報酬ラベリングを用いたオフライン強化学習
実走行データに人間の判断に沿った報酬ラベルを自動生成し、遮蔽歩行者横断シーンでの自動緊急ブレーキをオフライン強化学習で訓練する手法を提案した。
原題: Offline Reinforcement Learning using Human-Aligned Reward Labeling for Autonomous Emergency Braking in Occluded Pedestrian Crossing / Vinal Asodia, Barkin Dagda, Yinglong He 他
日本語で読む →