論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文連続制御/強化学習機械学習
行動前に選択せよ:連続制御のための空間的に分離された行動反復
強化学習において、行動の各次元ごとに独立して「行動するか反復するか」を閉ループで選択する新フレームワークSDARを提案し、行動の持続性と多様性のバランスを改善した。
原題: Select before Act: Spatially Decoupled Action Repetition for Continuous Control / Buqing Nie, Yangqing Fu, Yue Gao
日本語で読む → - 論文飛行制御/強化学習ロボティクス
深層強化学習によるマルチロータ航空ロボットの運動制御
ドローンによる積層造形の運動制御に深層強化学習を適用し、DDPGとTD3をカリキュラム学習で比較した。TD3が質量変化のある状況でも安定して高精度・高成功率を達成した。
原題: Motion Control in Multi-Rotor Aerial Robots Using Deep Reinforcement Learning / Gaurav Shetty, Mahya Ramezani, Hamed Habibi 他
日本語で読む → - 論文自動運転/強化学習画像認識
RAD: 大規模3DGSベース強化学習によるエンドツーエンド自動運転ポリシーの学習
3Dガウシアンスプラッティングで構築したフォトリアルな閉ループ環境で強化学習を行い、模倣学習を正則化として併用することで、衝突率を大幅に低減した自動運転ポリシーを学習する手法を提案。
原題: RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning / Hao Gao, Shaoyu Chen, Bo Jiang 他
日本語で読む → - 論文UAV/強化学習ロボティクス
少数ショットメタオフライン強化学習による耐障害性UAV軌道計画
オフライン強化学習(CQL)とメタ学習(MAML)を組み合わせ、オンライン相互作用なしにUAVの軌道とスケジューリングを最適化し、未知環境にも適応できる手法を提案した。
原題: Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning / Eslam Eldeeb, Hirley Alves
日本語で読む → - 論文強化学習ロボティクス
TDMPBC:自己模倣強化学習によるヒューマノイドロボット制御
強化学習において、タスクに関連する可能性のある軌道を自己模倣することで、ヒューマノイドロボットの制御性能を大幅に向上させるフレームワークSIRLを提案した。
原題: TDMPBC: Self-Imitative Reinforcement Learning for Humanoid Robot Control / Zifeng Zhuang, Diyuan Shi, Runze Suo 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
マルチエージェント強化学習のための低ランクエージェント特化適応(LoRASA)
共有ポリシーに低ランクのエージェント特化行列を追加することで、パラメータ共有の効率性を保ちつつ各エージェントの専門化を促進するマルチエージェント強化学習手法を提案。
原題: Low-Rank Agent-Specific Adaptation (LoRASA) for Multi-Agent Policy Learning / Beining Zhang, Aditya Kapoor, Mingfei Sun
日本語で読む → - 論文飛行制御/強化学習ロボティクス
深層強化学習によるソフトアクチュエータ昆虫サイズ飛行ロボットのホバリング飛行
遅延や不確かさに対処するため、状態行動再マッチング付き行動クローニングとPPOを組み合わせた深層強化学習制御器を設計し、720mgと850mgのソフト駆動昆虫サイズ飛行ロボットでゼロショットホバリングを実現した。
原題: Hovering Flight of Soft-Actuated Insect-Scale Micro Aerial Vehicles using Deep Reinforcement Learning / Yi-Hsuan Hsiao, Wei-Tung Chen, Yun-Sheng Chang 他
日本語で読む → - 論文自動運転/強化学習/LLMAI
TeLL-Drive: 教示LLMが導く深層強化学習による自動運転の強化
教示LLMが生成した高レベル運転戦略を注意機構で強化学習エージェントに融合し、自動運転の意思決定を高成功率・高堅牢・リアルタイム化したハイブリッド枠組みを提案。
原題: TeLL-Drive: Enhancing Autonomous Driving with Teacher LLM-Guided Deep Reinforcement Learning / Chengkai Xu, Jiaqi Liu, Shiyu Fang 他
日本語で読む → - 論文強化学習ベンチマーク機械学習
記憶・ベンチマーク・ロボット:強化学習で複雑なタスクを解くためのベンチマーク
記憶を必要とする強化学習タスクの分類と、多様な場面で記憶能力を評価できる統一ベンチマークMIKASA、および卓上ロボット操作向けの32タスクを提案した。
原題: Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning / Egor Cherepanov, Nikita Kachaev, Alexey K. Kovalev 他
日本語で読む → - 論文強化学習/耐故障制御ロボティクス
水中ロボットのためのクロスプラットフォーム学習ベース耐故障浮上コントローラ
強化学習を用いて、故障したアクチュエータを特定せずに残りのアクチュエータだけで浮上できる耐故障コントローラを開発し、異なる水中ロボット間で制御方策の一部を転移学習することで学習効率と汎化性能を向上させた。
原題: Cross-platform Learning-based Fault Tolerant Surfacing Controller for Underwater Robots / Yuya Hamamatsu, Walid Remmas, Jaan Rebane 他
日本語で読む → - 論文制御/強化学習制御
強化学習によるクアッドロータUAVのPIDゲイン予測
強化学習(DDPG)を用いてクアッドロータのPIDゲインをオンラインで微調整し、手動調整よりも姿勢追従性能を大幅に改善する手法を提案・検証した。
原題: Reinforcement Learning Based Prediction of PID Controller Gains for Quadrotor UAVs / Serhat Sönmez, Luca Montecchio, Simone Martini 他
日本語で読む → - 論文制御×強化学習制御
深層Expected Sarsaと非線形時間差分学習を用いた収束型NMPCベース強化学習
NMPCの最適重みを強化学習で学習する手法を提案し、ニューラルネットで行動価値関数を近似して計算負荷を半減、さらに勾配時間差分法でパラメータの発散を防ぎ安定収束を実現した。
原題: Convergent NMPC-based Reinforcement Learning Using Deep Expected Sarsa and Nonlinear Temporal Difference Learning / Amine Salaje, Thomas Chevet, Nicolas Langlois
日本語で読む → - 論文強化学習機械学習
拡散ポリシーのための効率的なオンライン強化学習
拡散ポリシーをオンライン強化学習で効率的に学習するため、損失関数を再重み付けしたReweighted Score Matchingを提案し、DPMDとSDACの2アルゴリズムを開発した。
原題: Efficient Online Reinforcement Learning for Diffusion Policy / Haitong Ma, Tianyi Chen, Kai Wang 他
日本語で読む → - 論文モデルベース強化学習機械学習
TD-M(PC)²: ポリシー制約による時間差分MPCの改善
モデルベース強化学習における価値過大評価問題を、プランナーと学習ポリシーの不一致に起因すると分析し、ポリシー正則化項でOODクエリを減らして価値学習を改善する手法を提案。
原題: TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint / Haotian Lin, Pengcheng Wang, Jeff Schneider 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
マルチエージェント強化学習における時間・エージェント間の報酬再分配
マルチエージェント強化学習の信用割り当て問題に対し、モデル精度に依存せず最適方策を保証する報酬再分配手法TAR²を提案し、SMACLiteやGRFで学習加速と性能向上を示した。
原題: Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning / Aditya Kapoor, Kale-ab Tessera, Mayank Baranwal 他
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
深層ニューラルネットワーク代理モデルを用いた水中ソフトフィンのひれ振動運動制御
水中ロボットのソフトフィン駆動において、DNN代理モデルをシミュレータとして強化学習を行い、実機の推力制御を高精度化した研究。
原題: Underwater Soft Fin Flapping Motion with Deep Neural Network Based Surrogate Model / Yuya Hamamatsu, Pavlo Kupyn, Roza Gkliva 他
日本語で読む → - 論文強化学習/飛行制御機械学習
トンボ型タンデム翼実験機のためのConcert強化学習によるリアルタイム制御
トンボを模したタンデム翼実験機の複雑な空力制御に対し、古典制御と強化学習を組み合わせたCRL2RTアルゴリズムを提案し、2500Hz超のリアルタイム制御と追従性能の大幅な向上を実現した。
原題: Real Time Control of Tandem-Wing Experimental Platform Using Concerto Reinforcement Learning / Zhang Minghao, Yang Xiaojun, Wang Zhihe 他
日本語で読む → - 論文階層型強化学習ロボティクス
DHP: 階層型強化学習エージェントのための離散階層計画
サブゴールの到達可能性を離散的に判定して木構造の計画を再帰的に構築する階層型強化学習手法を提案し、長期的な視覚計画の成功率とデータ効率を大幅に改善した。
原題: DHP: Discrete Hierarchical Planning for Hierarchical Reinforcement Learning Agents / Shashank Sharma, Janina Hoffmann, Vinay Namboodiri
日本語で読む → - 論文マルチエージェント強化学習cs.MA
大規模言語モデルを活用した効果的で説明可能なマルチエージェント信用割当
マルチエージェント強化学習の信用割当問題を、LLMによる報酬分解とタスク割当として再定式化し、各エージェントの貢献を評価する手法を提案した。
原題: Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment / Kartik Nagpal, Dayi Dong, Jean-Baptiste Bouvier 他
日本語で読む → - 論文模倣学習/強化学習ロボティクス
DFM: 表現豊かなダンス動作学習のための深層フーリエ模倣
周波数領域の動作表現と強化学習を組み合わせ、局所周期性の制約を緩めることで、ダンス動作の高精度追従と滑らかな遷移、移動や視線制御などの並行タスクを可能にする手法を提案。
原題: DFM: Deep Fourier Mimic for Expressive Dance Motion Learning / Ryo Watanabe, Chenhao Li, Marco Hutter
日本語で読む → - 論文ロバスト強化学習/ベンチマーク機械学習
Robust Gymnasium:ロバスト強化学習のための統合モジュラー型ベンチマーク
ロバスト強化学習の標準ベンチマークが不足している問題に対し、エージェントの観測・報酬・行動・環境の多様な撹乱をサポートする60以上のタスク環境を備えた統合ベンチマークを提案し、既存手法を評価した。
原題: Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning / Shangding Gu, Laixi Shi, Muning Wen 他
日本語で読む → - 論文安全強化学習機械学習
非線形システム制御のための安全な継続強化学習手法の設計
継続強化学習と安全強化学習を組み合わせ、非線形・非定常システムで安全性を保ちながら過去の知識を保持するための報酬整形手法を検討した論文。
原題: On the Design of Safe Continual RL Methods for Control of Nonlinear Systems / Austin Coursey, Marcos Quinones-Grueiro, Gautam Biswas
日本語で読む → - 論文強化学習cs.SD
人間参加型強化学習による音楽生成
人間のフィードバックを取り入れた強化学習(HITL RL)と音楽理論を組み合わせ、ユーザーの好みを報酬として楽曲をリアルタイム生成する枠組みを提案した。
原題: Music Generation using Human-In-The-Loop Reinforcement Learning / Aju Ani Justus
日本語で読む → - 論文強化学習機械学習
進化戦略による強化学習でのTransformerの訓練
進化戦略を用いてDecision Transformerを強化学習で訓練し、MuJoCoやAtariで高性能なエージェントを生成できることを示した。
原題: Utilizing Evolution Strategies to Train Transformers in Reinforcement Learning / Matyáš Lorenc, Roman Neruda
日本語で読む → - 論文強化学習/プランニングAI
階層型目標条件付き方策プランニングによるマルチゴール強化学習
強化学習と自動プランニングを組み合わせ、短い目標条件付き方策を階層的に整理し、MCTSで高レベル行動を計画することで、サンプル効率と推論速度を向上させる枠組みを提案した。
原題: Proposing Hierarchical Goal-Conditioned Policy Planning in Multi-Goal Reinforcement Learning / Gavin B. Rens
日本語で読む → - 論文安全強化学習機械学習
DIAL: 安全クリティカルシステムのためのマルチタスク制約の分布情報適応学習
複数タスクに共通する制約分布を模倣学習で獲得し、リスクレベルを調整して新しいタスクに適応することで、タスク固有の制約定義なしに安全な強化学習を実現する手法を提案した。
原題: DIAL: Distribution-Informed Adaptive Learning of Multi-Task Constraints for Safety-Critical Systems / Se-Wook Yoo, Seung-Woo Seo
日本語で読む → - 論文逆強化学習機械学習
抽象的状態を介した転移可能な報酬の逆学習
複数の異なる環境での行動軌跡から抽象的な報酬関数を逆強化学習で獲得し、未知の環境でもタスク行動を学習できることを示した。
原題: Inversely Learning Transferable Rewards via Abstracted States / Yikang Gui, Prashant Doshi
日本語で読む → - 論文安全フィルタ/強化学習制御
ベースに戻れ:到達回避安全フィルタによるハンズオフ学習に向けて
到達回避問題の価値関数から安全フィルタを構築し、ロボットが自律的に安全なリセットを行えるようにすることで、実世界強化学習のハンズオフ訓練を効率化する手法を提案。
原題: Back to Base: Towards Hands-Off Learning via Safe Resets with Reach-Avoid Safety Filters / Azra Begzadić, Nikhil Uday Shinde, Sander Tonkens 他
日本語で読む → - 論文強化学習ロボティクス
部分的微分可能報酬に対する改良型時間逆伝播
部分的にしか微分できない報酬でも、Q値関数を活用して勾配バイアスを軽減し、ドローンの制御方策を効率的に学習する手法を提案。
原題: ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards / Fanxing Li, Fangyu Sun, Tianbao Zhang 他
日本語で読む → - 論文進化計算/強化学習cs.NE
行動変異による大規模並列化で方策勾配品質多様性をスケーリング
MAP-Elitesを方策勾配で拡張し、集中型actor-criticに依存せず大規模並列化可能にしたASCII-MEを提案。単一GPUで250秒未満に高性能な多様方策群を生成し、既存手法より平均5倍高速。
原題: Scaling Policy Gradient Quality-Diversity with Massive Parallelization via Behavioral Variations / Konstantinos Mitsides, Maxence Faldor, Antoine Cully
日本語で読む →