論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文オフライン強化学習ロボティクス
ロボット制御のためのオフライン強化学習における行動摂動に対するロバスト性評価
オフライン強化学習手法のロバスト性を脚式ロボットで評価し、関節トルクへのランダム・敵対的摂動に対してオンライン手法より脆弱であることを示した。
原題: Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations / Shingo Ayabe, Takuto Otomo, Hiroshi Kera 他
日本語で読む → - 論文オフライン強化学習機械学習
ACL-QL: オフライン強化学習のためのQ学習における適応的保守レベル
オフライン強化学習において、状態行動ペアごとに保守性の度合いを適応的に制御する手法ACL-QLを提案し、過度に保守的になる問題を緩和して性能を向上させた。
原題: ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning / Kun Wu, Yinuo Zhao, Zhiyuan Xu 他
日本語で読む → - 論文強化学習ロボティクス
強化学習のための適応的報酬設計
LTLで指定された複雑なタスクを強化学習で解く際、従来の疎な報酬ではなく、サブタスク達成を促す報酬関数群を提案し、学習中に動的に更新する適応的報酬整形手法を開発した。
原題: Adaptive Reward Design for Reinforcement Learning / Minjae Kwon, Ingy ElSayed-Aly, Lu Feng
日本語で読む → - 論文強化学習/ナビゲーションロボティクス
分布強化学習に基づく自律水上艇の統合的意思決定と制御
LiDARとオドメトリのみを用い、分布強化学習で連続行動空間の推力指令を生成し、COLREGs遵守と安全・効率的な航行を両立する自律水上艇ナビゲーションを提案した。
原題: Distributional Reinforcement Learning based Integrated Decision Making and Control for Autonomous Surface Vehicles / Xi Lin, Paul Szenher, Yewei Huang 他
日本語で読む → - 論文知覚/強化学習ロボティクス
強化学習による知覚モデルへのシステムレベル安全要件の組み込み
システムレベルの安全要件をルールブック形式で安全スコアに変換し、強化学習の報酬に組み込むことで知覚モデルを微調整する手法を提案した。
原題: Incorporating System-level Safety Requirements in Perception Models via Reinforcement Learning / Weisi Fan, Jesse Lane, Qisai Liu 他
日本語で読む → - 論文強化学習機械学習
RAT: 深層強化学習エージェントの標的行動を誘導する敵対的攻撃
人間の選好に沿った意図方策を標的として学習させ、リプレイバッファ内の状態占有度を動的に調整することで、強化学習エージェントを特定の行動へ誘導する敵対的攻撃手法RATを提案した。
原題: RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors / Fengshuo Bai, Runze Liu, Yali Du 他
日本語で読む → - 論文強化学習・確率方策ロボティクス
計算効率を両立する任意の確率方策に向けた制限付き正規化フローの設計
正規化フローを適切に制限して解析的平均を可能にし、二峰性student-t分布をベースに用いることで表現力と計算効率を両立した確率方策Bit-RNFを提案し、強化学習ベンチマークと実機ロボット実験で有効性を示した。
原題: Design of Restricted Normalizing Flow towards Arbitrary Stochastic Policy with Computational Efficiency / Taisuke Kobayashi, Takumi Aotani
日本語で読む → - 論文安全強化学習ロボティクス
物理モデル誘導による最悪ケースサンプリングを用いた安全強化学習
物理モデルを活用して安全上重要なコーナーケースを重点的にサンプリングし、安全な強化学習ポリシーを効率的に学習する手法を提案した。
原題: Physics-model-guided Worst-case Sampling for Safe Reinforcement Learning / Hongpeng Cao, Yanbing Mao, Lui Sha 他
日本語で読む → - 論文強化学習/飛行制御ロボティクス
TD3によるFPVゲートを通過するクアッドコプターのニューラルネットワーク制御
深層強化学習のTD3を用いてクアッドコプターの速度制御器を学習し、ゲート通過タスクを実機で実現した。
原題: Implementing TD3 to train a Neural Network to fly a Quadcopter through an FPV Gate / Patrick Thomas, Kevin Schroeder, Jonathan Black
日本語で読む → - 論文自動運転/強化学習ロボティクス
大規模言語モデルが導く自動運転意思決定のための深層強化学習
LLMを専門家として組み込み、専門家方策制約アルゴリズムとLLM介入型インタラクション機構で深層強化学習の学習効率と性能を高める自動運転意思決定フレームワークを提案した。
原題: Large Language Model guided Deep Reinforcement Learning for Decision Making in Autonomous Driving / Hao Pang, Zhenpo Wang, Guoqiang Li
日本語で読む → - 論文強化学習機械学習
制御を推論として捉えた時間差分学習におけるウェーバー・フェヒナーの法則
強化学習のTD誤差と更新量の非線形性に着目し、制御を推論として定式化する枠組みからウェーバー・フェヒナーの法則を導出して、その有用性を示す実装を提案した論文。
原題: Weber-Fechner Law in Temporal Difference learning derived from Control as Inference / Keiichiro Takahashi, Taisuke Kobayashi, Tomoya Yamanokuchi 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
エントロピー探索による安全なマルチエージェント協調
チーム制約下でのマルチエージェント強化学習において、観測エントロピー最大化で探索を促し、安全性を保ちつつ協調行動を学習する手法E2Cを提案。
原題: Safe Multiagent Coordination via Entropic Exploration / Ayhan Alp Aydeniz, Enrico Marchesini, Robert Loftin 他
日本語で読む → - 論文強化学習ロボティクス
逐次意思決定問題におけるセンサ冗長性の最適化
強化学習ポリシーがセンサ故障に耐えられるよう、コスト制約下でバックアップセンサの配置を最適化する手法を提案し、複数環境で有効性を検証した。
原題: Optimizing Sensor Redundancy in Sequential Decision-Making Problems / Jonas Nüßlein, Maximilian Zorn, Fabian Ritz 他
日本語で読む → - 論文強化学習機械学習
過去から逃げることで探索する強化学習手法RAMP
強化学習において、エージェントの過去の行動分布と現在の行動分布の乖離を最大化することで探索を促進する手法RAMPを提案し、迷路探索やロボット操作・歩行タスクで有効性を示した。
原題: Exploration by Running Away from the Past / Paul-Antoine Le Tolguenec, Yann Besse, Florent Teichteil-Koenigsbuch 他
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習のための二重緩和一般化
オフライン強化学習において、データセット外への過度な一般化を抑えつつ、適度な一般化を活用する二重緩和一般化(DMG)を提案し、Gym-MuJoCoやAntMazeで最高性能を達成した。
原題: Doubly Mild Generalization for Offline Reinforcement Learning / Yixiu Mao, Qi Wang, Yun Qu 他
日本語で読む → - 論文敵対的強化学習/自動運転シミュレーション機械学習
CRASH: 強化学習による敵対的シナリオ生成と安全性強化
自動運転車の安全性検証のため、強化学習で敵対的なNPCエージェントを制御し衝突を誘発するフレームワークCRASHを提案。さらに失敗事例を活用してプランナを反復改善する「安全性強化」手法を導入し、衝突率を26%削減した。
原題: CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening / Amar Kulkarni, Shangtong Zhang, Madhur Behl
日本語で読む → - 論文強化学習機械学習
ソフトマックス方策ミラー上昇法の高速収束
ソフトマックス方策ミラー上昇法(SPMA)を改良し、表形式MDPで線形収束を証明するとともに、線形関数近似や非線形関数近似に拡張してMuJoCoやAtariで性能を評価した。
原題: Fast Convergence of Softmax Policy Mirror Ascent / Reza Asad, Reza Babanezhad, Issam Laradji 他
日本語で読む → - 論文オフライン強化学習ロボティクス
視覚言語モデルのフィードバックによる実世界オフライン強化学習
視覚言語モデルからの選好フィードバックとタスクのテキスト記述を用いてオフラインデータセットに自動で報酬ラベルを付与し、実世界のロボット支援着衣タスクなどで有効な方策を学習するシステムを提案した。
原題: Real-World Offline Reinforcement Learning from Vision Language Model Feedback / Sreyas Venkataraman, Yufei Wang, Ziyu Wang 他
日本語で読む → - 論文手術ロボット/強化学習ロボティクス
da Vinci Research Kitを用いた強化学習による自律的な手術用灌流・吸引の学習
手術支援ロボットで灌流と吸引の2工程を視覚ベースの強化学習エージェントに学習させ、シミュレータから実機へ転移して人手に近い性能を達成した。
原題: Learning Autonomous Surgical Irrigation and Suction with the da Vinci Research Kit Using Reinforcement Learning / Yafei Ou, Mahdi Tavakoli
日本語で読む → - 論文目標条件付き強化学習機械学習
制約なし目標ナビゲーションのための世界モデル学習
リプレイバッファ内の任意のサブゴール間の状態遷移をモデル化する世界モデルベースの探索アルゴリズムMUNを提案し、新しい目標設定への汎化性能を向上させた。
原題: Learning World Models for Unconstrained Goal Navigation / Yuanlin Duan, Wensen Mao, He Zhu
日本語で読む → - 論文ドローンレース/強化学習ロボティクス
障害物を考慮した自律ドローンレースのための汎化可能な方策の学習
ドローンレースにおいて、トラックと障害物配置にドメインランダム化を適用し、並列経験収集と組み合わせることで、未知の障害物環境でも汎化する深層強化学習方策を学習した。
原題: Learning Generalizable Policy for Obstacle-Aware Autonomous Drone Racing / Yueqian Liu
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
安全で堅牢な自動運転高速道路ランプ進入のためのマルチエージェント深層強化学習の系統的研究
高速道路の合流地点において、複数車両のマルチエージェント深層強化学習を用いて衝突を最小化する制御器を学習し、その安全性と堅牢性を系統的に評価した。
原題: A Systematic Study of Multi-Agent Deep Reinforcement Learning for Safe and Robust Autonomous Highway Ramp Entry / Larry Schester, Luis E. Ortiz
日本語で読む → - 論文強化学習機械学習
行動系列を用いた粗から細へのQネットワークによるデータ効率的強化学習
行動系列を入力としてQ値を予測するクリティックを学習する強化学習手法CQN-ASを提案し、疎な報酬のヒューマノイド制御や卓上操作タスクでデータ効率と性能を向上させた。
原題: Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Reinforcement Learning / Younggyo Seo, Pieter Abbeel
日本語で読む → - 論文安全フィルタ/強化学習ロボティクス
Q学習に基づくモデルフリー安全フィルタ
Q学習を用いて任意のタスク方策の危険な行動をフィルタリングする、モデルフリーでプラグアンドプレイな安全フィルタ学習フレームワークを提案し、シミュレーションとソフトロボットアームで有効性を検証した。
原題: Q-learning-based Model-free Safety Filter / Guo Ning Sue, Yogita Choudhary, Richard Desatnik 他
日本語で読む → - 論文強化学習機械学習
バッチ更新・ターゲットネットワーク・リプレイバッファ不要の深層方策勾配法
リプレイバッファやバッチ更新を使わず、最新サンプルのみで学習するインクリメンタルな深層方策勾配法AVGを提案し、実ロボットでの有効性を示した。
原題: Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers / Gautham Vasan, Mohamed Elsayed, Alireza Azimi 他
日本語で読む → - 論文強化学習AI
生得的価値駆動強化学習による認知モデリング
生得的価値に基づく内発的動機を組み込んだ強化学習IVRLを提案し、VIZDoomでDQNやA2Cなどの既存手法より優れた性能を示した。
原題: Innate-Values-driven Reinforcement Learning based Cognitive Modeling / Qin Yang
日本語で読む → - 論文ナノロボティクス/強化学習ロボティクス
強化学習を用いたナノロボットの癌細胞検出・追跡シミュレーション
Q学習でナノロボットの移動を最適化し、生体環境中のバイオマーカー濃度勾配から癌細胞を自律検出するシミュレーション研究。
原題: Simulation of Nanorobots with Artificial Intelligence and Reinforcement Learning for Advanced Cancer Cell Detection and Tracking / Shahab Kavousinejad
日本語で読む → - 論文金融強化学習機械学習
ロボットが見て、ロボットが行う:ノイズの多い金融環境における模倣報酬
金融資産取引の強化学習において、トレンドラベリングアルゴリズムを専門家とした模倣学習を活用し、ノイズの多い報酬信号に頑健な報酬関数を提案した研究。
原題: Robot See, Robot Do: Imitation Reward for Noisy Financial Environments / Sven Goluža, Tomislav Kovačević, Stjepan Begušić 他
日本語で読む → - 論文オフライン強化学習機械学習
線形構造を持つfダイバージェンス正則化によるロバストオフライン強化学習
遷移ダイナミクスと正則化に潜在的な線形構造を導入したd-矩形線形RRMDPを提案し、fダイバージェンス正則化付きのロバスト正則化悲観的価値反復法(R2PVI)を開発して、理論的な性能保証と実験的な有効性を示した。
原題: Robust Offline Reinforcement Learning with Linearly Structured f-Divergence Regularization / Cheng Tang, Zhishuai Liu, Pan Xu
日本語で読む → - 論文強化学習ロボティクス
SuPLE: リアプノフ指数を報酬に用いたロボット学習
系のダイナミクスから計算される正のリアプノフ指数の和を報酬として用いることで、外部知識や補助的な探索なしにロボットの安定化学習を可能にする手法を提案。
原題: SuPLE: Robot Learning with Lyapunov Rewards / Phu Nguyen, Daniel Polani, Stas Tiomkin
日本語で読む →