論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/11/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文模倣学習/強化学習ロボティクス
BMP:Bスプラインと運動プリミティブの橋渡し
Bスプラインを運動プリミティブとして再定式化し、境界条件の充足と軌道分布の高次統計の両立を可能にしたBMPを提案。模倣学習と強化学習で既存手法より高い表現力と適用性を示した。
原題: BMP: Bridging the Gap between B-Spline and Movement Primitives / Weiran Liao, Ge Li, Hongyi Zhou 他
日本語で読む → - 論文強化学習/タスクスケジューリングAI
拡散モデル強化学習による依存関係を考慮したCAVタスクスケジューリング
依存関係をもつ複数のサブタスクからなるコネクテッド自動運転車(CAV)の計算タスクを、近隣CAVや基地局へ割り当てるスケジューリング問題を解くため、拡散モデルによる合成経験リプレイを組み込んだ強化学習アルゴリズムを提案した。
原題: Dependency-Aware CAV Task Scheduling via Diffusion-Based Reinforcement Learning / Xiang Cheng, Zhi Mao, Ying Wang 他
日本語で読む → - 論文模倣学習/強化学習ロボティクス
強化学習によるリザバーダイナミクス変調を用いた効率的なロボットスキル合成
リザバーコンピューティングと強化学習を組み合わせ、デモンストレーションにない動きもオンラインで生成できるロボット学習フレームワークを提案した。
原題: Modulating Reservoir Dynamics via Reinforcement Learning for Efficient Robot Skill Synthesis / Zahra Koulaeizadeh, Erhan Oztop
日本語で読む → - 論文強化学習機械学習
潜在状態クラスタの境界を探索する目標条件付き強化学習
現在の政策で到達可能な状態を潜在空間でクラスタリングし、その境界にある探索価値の高い目標を優先することで、目標条件付き強化学習の探索効率を高める手法CE²を提案した。
原題: Exploring the Edges of Latent State Clusters for Goal-Conditioned Reinforcement Learning / Yuanlin Duan, Guofeng Cui, He Zhu
日本語で読む → - 論文メタ強化学習機械学習
多様性を狙うことでオープンエンドシミュレータにおける適応的エージェント訓練を可能にする
複雑なオープンエンドシミュレータで多様な訓練タスクを進化的に生成する手法DIVAを提案し、メタ強化学習エージェントの適応能力を向上させる。
原題: Enabling Adaptive Agent Training in Open-Ended Simulators by Targeting Diversity / Robby Costales, Stefanos Nikolaidis
日本語で読む → - 論文安全強化学習ロボティクス
移動障害物下におけるロボット軌道の安全強化学習
移動障害物を避けるための退避ポリシーを強化学習で事前学習し、他タスクの学習時に衝突リスクを推定して安全な代替行動を選択する手法を提案。実機実験でリアルタイムな安全軌道生成を実証した。
原題: Safe Reinforcement Learning of Robot Trajectories in the Presence of Moving Obstacles / Jonas Kiemel, Ludovic Righetti, Torsten Kröger 他
日本語で読む → - 論文強化学習/汎用エージェント機械学習
Kinetix:オープンエンドな物理ベース制御タスクによる汎用エージェントの訓練
何千万もの2D物理タスクを自動生成し、Jax2Dという高速物理エンジンを用いて汎用強化学習エージェントを訓練。未見の人間設計環境をゼロショットで解き、微調整で標準RLを上回る性能を示した。
原題: Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks / Michael Matthews, Michael Beukman, Chris Lu 他
日本語で読む → - 論文強化学習機械学習
遅延報酬の単純和を超えて:強化学習のための非マルコフ報酬モデリング
遅延報酬が単純な報酬の和ではなく複雑な構造を持つ場合を扱うRLCoDe問題を提案し、非マルコフ成分の重み付き和でモデル化するCoDeTrを開発した。
原題: Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning / Yuting Tang, Xin-Qiang Cai, Jing-Cheng Pang 他
日本語で読む → - 論文安全強化学習機械学習
絶対的状態制約付き方策最適化:高確率での状態制約満足
強化学習において、確率的システムで状態ごとの安全制約を高い確率で満たす新しい方策探索アルゴリズムASCPOを提案し、ロボット歩行タスクで有効性を示した。
原題: Absolute State-wise Constrained Policy Optimization: High-Probability State-wise Constraints Satisfaction / Weiye Zhao, Feihan Li, Yifan Sun 他
日本語で読む → - 論文強化学習機械学習
ETGL-DDPG: 疎な報酬の連続制御のための深層決定論的方策勾配アルゴリズム
疎な報酬の連続制御タスクにおいて、探索手法εt-greedy、二重経験再生バッファGDRB、最長nステップリターンをDDPGに統合し、標準ベンチマークで性能を向上させた。
原題: ETGL-DDPG: A Deep Deterministic Policy Gradient Algorithm for Sparse Reward Continuous Control / Ehsan Futuhi, Shayan Karimi, Chao Gao 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
MARLIN: 言語ベースのロボット間交渉で導くマルチエージェント強化学習
大規模言語モデルによるロボット間の言語交渉を強化学習と組み合わせ、訓練初期の安全性と効率を高めるハイブリッド手法を提案し、実機・シミュレーションで有効性を示した。
原題: MARLIN: Multi-Agent Reinforcement Learning Guided by Language-Based Inter-Robot Negotiation / Toby Godfrey, William Hunt, Mohammad D. Soorati
日本語で読む → - 論文視覚強化学習ロボティクス
MENTOR: タスク指向摂動を備えた視覚強化学習のためのMixture-of-Expertsネットワーク
視覚強化学習のサンプル効率を改善するため、MLPをMixture-of-Expertsバックボーンに置き換え、タスク指向の摂動機構を導入した手法MENTORを提案。実機のマニピュレーションタスクで平均83%の成功率を達成した。
原題: MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning / Suning Huang, Zheyu Zhang, Tianhai Liang 他
日本語で読む → - 論文制約付き強化学習AI
適応的ポリシー切替による強化学習における時相論理制約の確率的充足
強化学習中に時相論理で表される制約を確率的に満たすため、報酬最大化と制約充足のポリシーを適応的に切り替える枠組みを提案し、理論的正当性とシミュレーションで有効性を示した。
原題: Probabilistic Satisfaction of Temporal Logic Constraints in Reinforcement Learning via Adaptive Policy-Switching / Xiaoshan Lin, Sadık Bera Yüksel, Yasin Yazıcıoğlu 他
日本語で読む → - 論文制約付き強化学習機械学習
敵対的制約付き方策最適化:バジェット適応による制約付き強化学習の改善
報酬最大化と制約予算の適応を敵対的な2段階で交互に最適化する制約付き強化学習手法を提案し、Safety Gymnasiumと四足歩行タスクで有効性を示した。
原題: Adversarial Constrained Policy Optimization: Improving Constrained Reinforcement Learning by Adapting Budgets / Jianmina Ma, Jingtian Ji, Yue Gao
日本語で読む → - 論文生体信号制御/強化学習/アシスティブロボティクス
STREAMS: 生体信号によるロボット制御を支援するマルチモーダルAIフレームワーク
生体信号を用いたロボットアーム制御において、深層強化学習と自己学習機構を組み合わせ、ノイズの多い入力から滑らかな軌道を生成する支援フレームワークを提案。シミュレーションと実機実験で成功率とユーザー満足度を大幅に改善した。
原題: STREAMS: An Assistive Multimodal AI Framework for Empowering Biosignal Based Robotic Controls / Ali Rabiee, Sima Ghafoori, Xiangyu Bai 他
日本語で読む → - 論文安全強化学習機械学習
ActSafe: 安全制約付き強化学習のための能動的探索
未知のダイナミクスに対する不確実性を考慮しつつ安全制約を守りながら探索するモデルベース強化学習手法を提案し、学習中の安全性と高性能を両立できることを示した。
原題: ActSafe: Active Exploration with Safety Constraints for Reinforcement Learning / Yarden As, Bhavya Sukhija, Lenart Treven 他
日本語で読む → - 論文階層的強化学習ロボティクス
拡散モデルとオプションの融合:時間的に拡張されたタスクのための階層的生成スキル構成
線形時相論理で指定された長期タスクを、拡散モデルと階層強化学習を組み合わせてオプションの連鎖に分解し、再計画しながら実行するフレームワークを提案。
原題: Diffusion Meets Options: Hierarchical Generative Skill Composition for Temporally-Extended Tasks / Zeyu Feng, Hao Luan, Kevin Yuchen Ma 他
日本語で読む → - 論文オフライン強化学習機械学習
オフダイナミクス強化学習のためのリターン拡張Decision Transformer
データが豊富なソースドメインから、データが少ないターゲットドメインへの方策学習を改善するため、Decision Transformer系フレームワークにおいてリターン分布をターゲットに合わせて拡張するREAG手法を提案し、理論的保証とD4RLでの性能向上を示した。
原題: Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning / Ruhan Wang, Yu Yang, Zhishuai Liu 他
日本語で読む → - 論文オフライン強化学習ロボティクス
マルチゴールオフライン強化学習のためのゴール条件付きDecision Transformer
ゴール状態を系列モデリングに組み込んだDecision Transformerにより、収集済みデータのみでロボットの多様なタスクを効率的に学習する手法を提案し、Franka Pandaのオフラインデータセットで有効性を示した。
原題: Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning / Paweł Gajewski, Dominik Żurek, Marcin Pietroń 他
日本語で読む → - 論文強化学習/LLM報酬機械学習
大規模言語モデルフィードバックによる意思決定エージェントのためのオンライン内的報酬
LLMのフィードバックを非同期で利用し、RL方策と内的報酬関数を同時に学習する分散アーキテクチャONIを提案。NetHackで最先端性能を達成し、大規模オフラインデータセットを不要にした。
原題: Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback / Qinqing Zheng, Mikael Henaff, Amy Zhang 他
日本語で読む → - 論文階層強化学習機械学習
効率的な階層強化学習のための分離された教師なしスキル発見
教師なしで分離されたスキルを学習し、階層強化学習で効率的に再利用する手法DUSDiを提案。
原題: Disentangled Unsupervised Skill Discovery for Efficient Hierarchical Reinforcement Learning / Jiaheng Hu, Zizhao Wang, Peter Stone 他
日本語で読む → - 論文安全強化学習ロボティクス
外乱オブザーバに基づく制御バリア関数と残差モデル学習を組み合わせた安全強化学習
外乱オブザーバと残差モデル学習を組み合わせた制御バリア関数により、不確かなダイナミクス下でも安全な強化学習を実現するフレームワークを提案し、Safety-gymと実機F1/10カーで有効性を示した。
原題: Disturbance Observer-based Control Barrier Functions with Residual Model Learning for Safe Reinforcement Learning / Dvij Kalaria, Qin Lin, John M. Dolan
日本語で読む → - 論文強化学習/制御ロボティクス
連続制御ポリシーにおける高周波振動のベンチマークと低減
強化学習ポリシーの高周波振動を抑える損失正則化とアーキテクチャ手法を分類・比較し、実機ロボットを含むベンチマークを実施。両者を組み合わせたハイブリッド手法が制御の滑らかさを26.8%改善しつつ性能低下を2.8%に抑えることを示した。
原題: Benchmarking Smoothness and Reducing High-Frequency Oscillations in Continuous Control Policies / Guilherme Christmann, Ying-Sheng Luo, Hanjaya Mandala 他
日本語で読む → - 論文強化学習ロボティクス
新規性に基づくサンプル再利用による連続ロボティクス制御
強化学習において、頻繁に観測される状態は更新を減らし、稀な新規状態には追加更新を行うことで、サンプルを効率的に再利用し、収束速度と成功率を向上させる手法NSRを提案した。
原題: Novelty-based Sample Reuse for Continuous Robotics Control / Ke Duan, Kai Yang, Houde Liu 他
日本語で読む → - 論文強化学習機械学習
複雑なQ関数における決定論的方策勾配の準最適性の緩和
強化学習において、Q関数の局所最適に陥りやすい問題を解決するため、複数の行動候補から最良を選び、Q関数を繰り返し近似するSAVOアーキテクチャを提案し、複雑なタスクでの性能向上を実証した。
原題: Mitigating Suboptimality of Deterministic Policy Gradients in Complex Q-functions / Ayush Jain, Norio Kosaka, Xinhu Li 他
日本語で読む → - 論文強化学習/車両制御ロボティクス
強化学習による参照不要のフォーミュラドリフト:走行データからタイヤエネルギー着想の実世界ポリシーへ
走行データから学習した車両モデル上で強化学習を行い、ウェイポイントに沿って実車でドリフト走行を実現した。
原題: Reference-Free Formula Drift with Reinforcement Learning: From Driving Data to Tire Energy-Inspired, Real-World Policies / Franck Djeumou, Michael Thompson, Makoto Suminaka 他
日本語で読む → - 論文オフライン強化学習機械学習
拡散モデル誘導型適応的再評価付き暗黙的Q学習
拡散モデルで状態行動系列を学習し、価値関数と組み合わせて適応的に意思決定の長さを調整するオフライン強化学習手法DIARを提案。長期的・報酬疎なタスクで既存手法を上回る。
原題: DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation / Jaehyun Park, Yunho Kim, Sejin Kim 他
日本語で読む → - 論文オフライン強化学習機械学習
動特性ずれに頑健な条件付き拡散プランナー
動特性が異なる大規模データと少量の目標データを条件付き拡散モデルで統合し、データ不足下のオフライン強化学習を改善する手法を提案。
原題: Off-dynamics Conditional Diffusion Planners / Wen Zheng Terence Ng, Jianda Chen, Tianwei Zhang
日本語で読む → - 論文ドローンレース/強化学習ロボティクス
環境をポリシーとして:未知のコースを走るドローンレースの学習
強化学習でドローンレースのポリシーを訓練する際、別のRLポリシーがエージェントの性能に応じて訓練環境を動的に調整することで、再訓練なしに未知のコースへ汎化できる手法を提案した。
原題: Environment as Policy: Learning to Race in Unseen Tracks / Hongze Wang, Jiaxu Xing, Nico Messikommer 他
日本語で読む → - 論文マルチエージェント強化学習制御
ポテンシャルゲームと低ランク政策構造によるマルチエージェント到達回避MDP
マルチエージェント到達回避MDPを局所フィードバック政策で解き、ポテンシャルゲーム構造を利用して通信・メモリ・計算量を削減しつつ最適解に近い性能を達成する手法を提案。
原題: Multi-agent Reach-avoid MDP via Potential Games and Low-rank Policy Structure / Adam Casselman, Abraham P. Vinod, Sarah H. Q. Li
日本語で読む →