論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
複雑な報酬関数のためのカリキュラム強化学習
複数の報酬項を持つ複雑なタスクに対し、単純な報酬から複雑な報酬へと段階的に移行する二段階カリキュラムを提案し、制約を守りつつタスクを達成する方策を学習できるようにした。
原題: Curriculum Reinforcement Learning for Complex Reward Functions / Kilian Freitag, Kristian Ceder, Rita Laezza 他
日本語で読む → - 論文強化学習機械学習
複数センサを用いた深層強化学習のためのマルチモーダル情報ボトルネック
自己中心画像と固有感覚からタスクに関連する統合表現を学習するマルチモーダル情報ボトルネックを提案し、サンプル効率とノイズに対するゼロショット頑健性を向上させた。
原題: Multimodal Information Bottleneck for Deep Reinforcement Learning with Multiple Sensors / Bang You, Huaping Liu
日本語で読む → - 論文教師なし強化学習機械学習
SkiLD: 因子間相互作用に導かれた教師なしスキル発見
状態を因子に分解し、因子間の多様な相互作用を引き起こすスキルを教師なしで学習する手法を提案。家庭環境ロボットなど長期的な疎報酬タスクで既存手法を上回る。
原題: SkiLD: Unsupervised Skill Discovery Guided by Factor Interactions / Zizhao Wang, Jiaheng Hu, Caleb Chuck 他
日本語で読む → - 論文安全強化学習ロボティクス
安全フィルタを訓練中に組み込む:強化学習エージェントの性能とサンプル効率の改善
強化学習の訓練時に安全フィルタを組み込み、エージェントがフィルタを考慮して学習できるようにする複数の手法を分析し、Crazyflie 2.0ドローンでの実験で性能・サンプル効率・安全性・チャタリングへの影響を評価した。
原題: Safety Filtering While Training: Improving the Performance and Sample Efficiency of Reinforcement Learning Agents / Federico Pizarro Bejarano, Lukas Brunke, Angela P. Schoellig
日本語で読む → - 論文マルチエージェント強化学習cs.MA
OPTIMA: 協調を考慮した自動運転車を実現するインテリジェントマルチエージェントシステム向け最適化ポリシー
接続自動運転車の協調タスク向けに、環境との相互作用からのデータサンプリングとマルチエージェント強化学習を交互に行う分散学習フレームワークOPTIMAを提案し、安全性と効率性を両立させる。
原題: OPTIMA: Optimized Policy for Intelligent Multi-Agent Systems Enables Coordination-Aware Autonomous Vehicles / Rui Du, Kai Zhao, Jinlong Hou 他
日本語で読む → - 論文強化学習/制御機械学習
直駆動タンデム翼実験プラットフォーム向けのプラグアンドプレイ完全オンザジョブリアルタイム強化学習アルゴリズム
タンデム翼の非線形空力干渉下での運動制御のため、物理に着想を得たルールベース方策合成と摂動モジュールを組み込んだプラグアンドプレイ型リアルタイム強化学習アルゴリズムを開発し、複数のランダム動作条件で追従精度と収束速度を大幅に改善した。
原題: A Plug-and-Play Fully On-the-Job Real-Time Reinforcement Learning Algorithm for a Direct-Drive Tandem-Wing Experiment Platforms Under Multiple Random Operating Conditions / Zhang Minghao, Song Bifeng, Yang Xiaojun 他
日本語で読む → - 論文モデルベース強化学習機械学習
トンプソンサンプリングによる楽観的探索を用いた効率的なモデルベース強化学習
遷移と報酬の不確かさを同時に考慮するトンプソンサンプリングに基づく楽観的探索手法を提案し、MuJoCoやVMASの連続制御タスクでスパース報酬環境での学習を大幅に加速できることを示した。
原題: Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling / Jasmine Bayrooti, Carl Henrik Ek, Amanda Prorok
日本語で読む → - 論文強化学習/報酬設計機械学習
ORSO: オンライン報酬選択と方策最適化による報酬設計の加速
報酬整形関数の選択をオンラインモデル選択問題として定式化し、人間の介入なしに高性能な報酬関数を自動特定する手法を提案。連続制御タスクでデータ効率と計算時間を大幅に改善。
原題: ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization / Chen Bo Calvin Zhang, Zhang-Wei Hong, Aldo Pacchiano 他
日本語で読む → - 論文モデルベース強化学習機械学習
Drama: Mambaを活用したモデルベース強化学習のサンプル効率とパラメータ効率
Mambaをベースにした状態空間モデルで世界モデルを構築し、Atari100kで競争力のある性能を700万パラメータで達成した研究。
原題: Drama: Mamba-Enabled Model-Based Reinforcement Learning Is Sample and Parameter Efficient / Wenlong Wang, Ivana Dusparic, Yucheng Shi 他
日本語で読む → - 論文強化学習ロボティクス
目標対比報酬による実機ロボット強化学習
人間や他ロボットの行動なし動画から密な報酬関数を学習し、実機ロボットの強化学習を効率化する手法GCRを提案。
原題: On-Robot Reinforcement Learning with Goal-Contrastive Rewards / Ondrej Biza, Thomas Weng, Lingfeng Sun 他
日本語で読む → - 論文安全強化学習AI
安全変調アクター・クリティック法:モデルフリー安全強化学習とUAVホバリングへの応用
安全制約を満たすために行動を変調する「安全変調器」とQ値の過大評価を抑える分布型クリティックを組み合わせた強化学習手法を提案し、UAVホバリング実験で有効性を示した。
原題: A Safety Modulator Actor-Critic Method in Model-Free Safe Reinforcement Learning and Application in UAV Hovering / Qihan Qi, Xinsong Yang, Gang Xia 他
日本語で読む → - 論文安全強化学習/制御ロボティクス
外乱下でのマルチコプタ衝突回避追従のための安全強化学習フィルタ
外乱がある環境でマルチコプタが衝突せずに軌道追従できるよう、ロバスト制御バリア関数と二次計画法を組み合わせた安全フィルタを強化学習に導入した研究。
原題: Safe Reinforcement Learning Filter for Multicopter Collision-Free Tracking under disturbances / Qihan Qi, Xinsong Yang, Gang Xia
日本語で読む → - 論文逆強化学習ロボティクス
教師なし特徴選択による透明な報酬モデルの学習
専門家のデモデータから、自動選択した状態特徴を用いて明示的な形のコンパクトな報酬関数を推定し、強化学習で専門家に近い方策を学習する手法を提案した論文。
原題: Learning Transparent Reward Models via Unsupervised Feature Selection / Daulet Baimukashev, Gokhan Alcan, Kevin Sebastian Luck 他
日本語で読む → - 論文モデルベース強化学習機械学習
注意を向けるべき対象を際立たせる:視覚的妨害下でのタスク関連再構成による視覚制御
視覚的妨害がある環境でのモデルベース強化学習において、セグメンテーションマスクを用いてタスク関連部分のみを再構成する補助タスクを導入し、表現学習を効率化する手法を提案。
原題: Make the Pertinent Salient: Task-Relevant Reconstruction for Visual Control with Distractions / Kyungmin Kim, JB Lanier, Pierre Baldi 他
日本語で読む → - 論文強化学習機械学習
DODT: DreamerのActor-Criticによる軌道予測を用いたオンラインDecision Transformerの強化
Dreamerが生成する予測軌道とOnline Decision Transformerを組み合わせ、相互に強化し合う並列学習フレームワークを提案し、サンプル効率と報酬を改善した。
原題: DODT: Enhanced Online Decision Transformer Learning through Dreamer's Actor-Critic Trajectory Forecasting / Eric Hanchen Jiang, Zhi Zhang, Dinghuai Zhang 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
LLM駆動のデータ合成とポリシー適応による自動運転向けロバスト強化学習
LLMエージェントが生成したオフラインデータを蒸留し、ロバスト蒸留と混合ポリシー適応を組み合わせて、自動運転向けの効率的でロバストな強化学習ポリシーを訓練するRAPIDを提案した。
原題: Robust RL with LLM-Driven Data Synthesis and Policy Adaptation for Autonomous Driving / Sihao Wu, Jiaxu Liu, Xiangyu Yin 他
日本語で読む → - 論文強化学習ロボティクス
不完全なシステムダイナミクスを活用した強化学習の誘導
システムの既知・未知部分を分離し、部分的なモデルに基づく埋め込みコントローラで強化学習を誘導することで、サンプル効率と汎化性能を改善する手法を提案した。
原題: Guiding Reinforcement Learning with Incomplete System Dynamics / Shuyuan Wang, Jingliang Duan, Nathan P. Lawrence 他
日本語で読む → - 論文強化学習機械学習
TOP-ERL: Transformerを用いたオフポリシー・エピソディック強化学習
長い行動軌跡をセグメントに分割し、Transformerベースのクリティックで各セグメントの状態行動価値を推定することで、エピソディック強化学習をオフポリシーで効率的に学習する手法を提案した。
原題: TOP-ERL: Transformer-based Off-Policy Episodic Reinforcement Learning / Ge Li, Dong Tian, Hongyi Zhou 他
日本語で読む → - 論文水中ロボティクス/強化学習ロボティクス
MarineGym: 高忠実度RLシミュレーションによる水中ビークルの高速学習
GPU加速により実時間比1万倍の速度で水中ロボットの強化学習を可能にするシミュレーションフレームワークMarineGymを提案し、4つの追従タスクで有効性を検証した。
原題: MarineGym: Accelerated Training for Underwater Vehicles with High-Fidelity RL Simulation / Shuguang Chu, Zebin Huang, Mingwei Lin 他
日本語で読む → - 論文強化学習/水中ロボット/sim2realロボティクス
泳ぎを学ぶ:スラスタ駆動型自律水中ロボットの6自由度制御のための強化学習
強化学習によりスラスタ駆動型AUVの6自由度制御を実現し、シミュレータから実機へのゼロショット転移を達成した研究。
原題: Learning to Swim: Reinforcement Learning for 6-DOF Control of Thruster-driven Autonomous Underwater Vehicles / Levi Cai, Kevin Chang, Yogesh Girdhar
日本語で読む → - 論文強化学習/制御ロボティクス
速度履歴を用いたSoft Actor-CriticによるIROS'24競技への挑戦
Soft Actor-CriticにCNNで履歴を符号化したコンテキストベクトルを追加し、PendubotとAcrobotの不安定な劣駆動系を安定化する手法を提案した。
原題: Velocity-History-Based Soft Actor-Critic Tackling IROS'24 Competition "AI Olympics with RealAIGym" / Tim Lukas Faust, Habib Maraqten, Erfan Aghadavoodi 他
日本語で読む → - 論文強化学習cs.CR
自律型軍用車両のインシデント対応における強化学習の探求
強化学習を用いて、軍用無人車両へのサイバー攻撃に自律的に対応するエージェントを訓練し、簡単なシミュレーションから実車両まで適用可能であることを示した。
原題: Exploring reinforcement learning for incident response in autonomous military vehicles / Henrik Madsen, Gudmund Grov, Federico Mancini 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
単純から複雑への知識転移:自動運転意思決定のための安全で効率的な強化学習フレームワーク
軽量環境で訓練した教師モデルが複雑な実環境で生徒エージェントを介入支援し、徐々に自立させる強化学習フレームワークS2CDを提案。自動運転の意思決定を安全かつ効率的に学習させる。
原題: Knowledge Transfer from Simple to Complex: A Safe and Efficient Reinforcement Learning Framework for Autonomous Driving Decision-Making / Rongliang Zhou, Jiakun Huang, Mingjun Li 他
日本語で読む → - 論文強化学習制御
深層決定論的方策勾配法による到達・回避・滞在問題の解法
強化学習ベースの到達可能性解析を拡張し、目標への到達・障害物回避・目標付近への滞在を同時に達成する二段階DDPG手法を提案した論文。
原題: Solving Reach-Avoid-Stay Problems Using Deep Deterministic Policy Gradients / Gabriel Chenevert, Jingqi Li, Achyuta kannan 他
日本語で読む → - 論文強化学習機械学習
データ拡張なしで視覚ベース強化学習をゼロショット汎化
視覚ベース強化学習において、連想記憶と潜在空間の disentanglement を組み合わせることで、データ拡張に頼らず未知環境へのゼロショット汎化を実現する手法 ALDA を提案した。
原題: Zero-Shot Generalization of Vision-Based RL Without Data Augmentation / Sumeet Batra, Gaurav S. Sukhatme
日本語で読む → - 論文強化学習ロボティクス
時相論理目標に対するサンプル効率の良い強化学習:タスク仕様を活用した探索誘導
LTLで記述された高レベル目標に対し、タスク達成に寄与しそうな方向へ探索を偏らせる新手法を提案し、サンプル効率を大幅に改善した。
原題: Sample-Efficient Reinforcement Learning with Temporal Logic Objectives: Leveraging the Task Specification to Guide Exploration / Yiannis Kantaros, Jun Wang
日本語で読む → - 論文強化学習機械学習
強化学習による最小コスト到達回避問題の解法
到達と安全回避の制約下で累積コストを最小化する問題を、Hamilton-Jacobi到達可能性との関連を用いて強化学習で直接解くRC-PPOを提案し、Mujocoベンチマークで最大57%のコスト削減を達成した。
原題: Solving Minimum-Cost Reach Avoid using Reinforcement Learning / Oswin So, Cheng Ge, Chuchu Fan
日本語で読む → - 論文強化学習/汎化画像認識
重要なものに集中:視覚ベース強化学習の汎化のための分離モデル
画像再構成を活用しつつ、タスク関連・無関連の表現を分離する2分岐モデルと一貫性損失で、未知環境への汎化性能を高める手法SMGを提案。
原題: Focus On What Matters: Separated Models For Visual-Based RL Generalization / Di Zhang, Bowen Lv, Hai Zhang 他
日本語で読む → - 論文オフライン強化学習/表現学習/視覚的妨害物機械学習
DMC-VB:視覚的妨害物を含む制御のための表現学習ベンチマーク
視覚的妨害物がある環境でのオフライン強化学習エージェントの頑健性を評価するための大規模データセットとベンチマークを提案し、事前学習済み表現が政策学習に寄与しないことや状態と画素観測の間の表現ギャップを明らかにした。
原題: DMC-VB: A Benchmark for Representation Learning for Control with Visual Distractors / Joseph Ortiz, Antoine Dedieu, Wolfgang Lehrach 他
日本語で読む → - 論文選好ベース強化学習機械学習
多種類選好学習:等価選好を活用した選好ベース強化学習
人間の等価選好も学習に取り入れることで、選好ベース強化学習のフィードバック効率を向上させる手法を提案し、複数のタスクで有効性を検証した。
原題: Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences / Ziang Liu, Junjie Xu, Xingjiao Wu 他
日本語で読む →