論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/1/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文交通制御/強化学習ロボティクス
強化学習による混合交通の効率最適化:トポロジー非依存アプローチとベンチマーク
自動運転車が収集したデータで人間運転車に影響を与え、多様な道路トポロジーで交通効率を最適化する強化学習手法を提案し、20カ国444シナリオの実世界混合交通ベンチマークを公開した。
原題: Optimizing Efficiency of Mixed Traffic through Reinforcement Learning: A Topology-Independent Approach and Benchmark / Chuyang Xiao, Dawei Wang, Xinzheng Tang 他
日本語で読む → - 論文逆強化学習機械学習
抽象的状態を介した転移可能な報酬の逆学習
複数の異なる環境での行動軌跡から抽象的な報酬関数を逆強化学習で獲得し、未知の環境でもタスク行動を学習できることを示した。
原題: Inversely Learning Transferable Rewards via Abstracted States / Yikang Gui, Prashant Doshi
日本語で読む → - 論文自動運転/強化学習機械学習
階層型強化学習による複雑な交通シナリオでの広範な探索
複雑な交通環境での自動運転制御に向け、意思決定を階層的に分解し高レベル・低レベル制御器を別々に訓練する強化学習フレームワークを提案し、複雑な高速道路状況での優位性を示した。
原題: Extensive Exploration in Complex Traffic Scenarios using Hierarchical Reinforcement Learning / Zhihao Zhang, Ekim Yurtsever, Keith A. Redmill
日本語で読む → - 論文跳躍/強化学習/sim2realロボティクス
並列機構を持つ単脚ロボットの跳躍学習
並列機構の単脚ロボットの跳躍を強化学習で制御するため、長履歴フィードバックと直列近似・トルク変換でsim-to-realを実現した。
原題: Learning to Hop for a Single-Legged Robot with Parallel Mechanism / Hongbo Zhang, Xiangyu Chu, Yanlin Chen 他
日本語で読む → - 論文強化学習ロボティクス
制約を報酬として:報酬関数なしでロボットを強化学習する手法
報酬関数の設計を不要にするため、複数の制約関数でタスクを定式化し、ラグランジュ法で制約付き強化学習を解く「Constraints as Rewards」を提案し、六輪伸縮脚ロボットの起立動作生成で有効性を示した。
原題: Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions / Yu Ishihara, Noriaki Takasugi, Kotaro Kawakami 他
日本語で読む → - 論文安全強化学習機械学習
最小限の監督による安全な強化学習
人手によるデモや設計済み制御器に頼らず、教師なし強化学習でオフラインデータを収集し、限られたデータでも安全なオンライン強化学習を可能にする「楽観的忘却」を提案した論文。
原題: Safe Reinforcement Learning with Minimal Supervision / Alexander Quessy, Thomas Richardson, Sebastian East
日本語で読む → - 論文強化学習/制御ロボティクス
カリキュラム学習によるクアッドロータのロバスト安定化のためのサンプル効率の良い強化学習
クアッドロータの安定化をエンドツーエンド強化学習で行う際、人間のカリキュラム学習に着想を得た3段階の学習カリキュラムを導入し、サンプル効率と収束時間を大幅に改善した。
原題: Curriculum-based Sample Efficient Reinforcement Learning for Robust Stabilization of a Quadrotor / Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy 他
日本語で読む → - 論文安全フィルタ/強化学習制御
ベースに戻れ:到達回避安全フィルタによるハンズオフ学習に向けて
到達回避問題の価値関数から安全フィルタを構築し、ロボットが自律的に安全なリセットを行えるようにすることで、実世界強化学習のハンズオフ訓練を効率化する手法を提案。
原題: Back to Base: Towards Hands-Off Learning via Safe Resets with Reach-Avoid Safety Filters / Azra Begzadić, Nikhil Uday Shinde, Sander Tonkens 他
日本語で読む → - 論文強化学習機械学習
人間整合型スキル発見:行動探索と整合性のバランス
人間のフィードバックを取り入れ、多様性と人間の価値観への整合性を同時に最適化するスキル発見フレームワークHaSDを提案し、安全で有用なスキルの発見を実現した。
原題: Human-Aligned Skill Discovery: Balancing Behaviour Exploration and Alignment / Maxence Hussonnois, Thommen George Karimpanal, Santu Rana
日本語で読む → - 論文マルチエージェント強化学習機械学習
不確実環境下での知識転移を用いたマルチエージェント深層強化学習による適応的目標位置推定
複数のセンシングエージェントが協調して目標を探索・検出・到達可能性を判断するMADRL手法を提案し、到達不能時の位置推定に転移学習を活用した。
原題: Adaptive Target Localization under Uncertainty using Multi-Agent Deep Reinforcement Learning with Knowledge Transfer / Ahmed Alagha, Rabeb Mizouni, Shakti Singh 他
日本語で読む → - 論文モデルベース強化学習ロボティクス
ロボット世界モデル:ロボティクスにおける堅牢な方策最適化のためのニューラルネットワークシミュレータ
複雑で部分的に観測可能な確率的ダイナミクスを捉える世界モデルを学習し、想像環境での効率的な方策訓練と実世界展開を可能にするフレームワークを提案。
原題: Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics / Chenhao Li, Andreas Krause, Marco Hutter
日本語で読む → - 論文自動運転/強化学習ロボティクス
LearningFlow: 大規模言語モデルによる都市運転のための自動方策学習ワークフロー
複数のLLMエージェントが協調してカリキュラムと報酬関数を自動生成し、都市運転の強化学習方策を効率的に学習させるフレームワークを提案した。
原題: LearningFlow: Automated Policy Learning Workflow for Urban Driving with Large Language Models / Zengqi Peng, Yubin Wang, Xu Han 他
日本語で読む → - 論文マルチエージェント強化学習画像認識
CSAOT: 協調マルチエージェントによる能動的物体追跡システム
単一デバイス上で複数のエージェントが役割分担し、MADRLとMixture of Expertsで協調して能動的物体追跡の精度とロバスト性を高める手法を提案。
原題: CSAOT: Cooperative Multi-Agent System for Active Object Tracking / Hy Nguyen, Bao Pham, Hung Du 他
日本語で読む → - 論文マルチタスク強化学習機械学習
モデルベース強化学習エージェントにおける効率的なマルチタスク学習のための知識転移
大規模なマルチタスクモデルベース強化学習エージェントを蒸留し、1Mパラメータの小型モデルで高性能を実現する知識転移手法を提案。
原題: Knowledge Transfer in Model-Based Reinforcement Learning Agents for Efficient Multi-Task Learning / Dmytro Kuzmenko, Nadiya Shvai
日本語で読む → - 論文強化学習機械学習
疎から密へ:目標指向強化学習における幼児に着想を得た報酬遷移
幼児の学習過程に倣い、疎な報酬からポテンシャルベースの密な報酬へと遷移させる手法を提案し、ロボットアーム操作や3Dナビゲーションで学習性能とサンプル効率が向上することを示した。
原題: From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning / Junseok Park, Hyeonseo Yang, Min Whoo Lee 他
日本語で読む → - 論文強化学習機械学習
オフライン方策改善のための能動的強化学習戦略
既存のオフラインデータを再利用しつつ、追加のオンライン経験を最小限に抑える能動的強化学習手法を提案し、連続制御環境で最大75%のインタラクション削減を実証した。
原題: Active Reinforcement Learning Strategies for Offline Policy Improvement / Ambedkar Dukkipati, Ranga Shaarad Ayyagari, Bodhisattwa Dasgupta 他
日本語で読む → - 論文強化学習機械学習
大規模行動空間における強化学習のためのアドバンテージベース最適化手法
大規模行動空間での強化学習において、各次元の行動価値をアドバンテージで調整するABQを提案し、BDQや連続行動ベースラインを上回る性能を示した。
原題: An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space / Hai Lin, Cheng Huang, Zhihong Chen
日本語で読む → - 論文脚式ロボット/強化学習/報酬設計ロボティクス
Video2Reward: 脚式ロボットの行動学習のための動画からの報酬関数生成
動画から対象行動のキーポイント軌道を抽出し、LLMで報酬関数を生成、さらに視覚的フィードバックで反復改善することで、脚式ロボットの行動学習を効率化する手法を提案。
原題: Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning / Runhao Zeng, Dingjie Zhou, Qiwei Liang 他
日本語で読む → - 論文強化学習/sim2realロボティクス
古典的ロボティクススタックへの強化学習統合:ロボットサッカーにおけるケーススタディ
ロボカップSPL向けに、古典的ロボティクススタック内に強化学習を統合し、マルチフィデリティsim2realとサブ行動分解・ヒューリスティック選択を組み合わせたアーキテクチャを開発し、2024年大会で優勝した。
原題: Reinforcement Learning Within the Classical Robotics Stack: A Case Study in Robot Soccer / Adam Labiosa, Zhihan Wang, Siddhant Agarwal 他
日本語で読む → - 論文強化学習ロボティクス
自律テストドライバーに向けて:強化学習による高性能ドライバーモデリング
深層強化学習でレーシングカーの自律テストドライバーを訓練し、トップドライバー並みの走行で車両セットアップ評価を可能にするとともに、模倣学習を組み合わせて人間らしい運転挙動も再現できるようにした。
原題: Towards an Autonomous Test Driver: High-Performance Driver Modeling via Reinforcement Learning / John Subosits, Jenna Lee, Shawn Manuel 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
スパースなマルチエージェント強化学習における最適方策保存のためのエージェント・時間クレジット割り当て
スパースなグローバル報酬を時間方向とエージェント方向に再分配するTAR²を提案し、ポテンシャルベース報酬整形との等価性を理論的に示して最適方策を保ちながら学習を安定・高速化した。
原題: Agent-Temporal Credit Assignment for Optimal Policy Preservation in Sparse Multi-Agent Reinforcement Learning / Aditya Kapoor, Sushant Swamy, Kale-ab Tessera 他
日本語で読む → - 論文マルチタスク強化学習/クアッドロータ制御ロボティクス
クアッドロータのためのマルチタスク強化学習
クアッドロータ制御において、共有された物理ダイナミクスを活用し、単一のポリシーで複数の機動(高速安定化、速度追従、自律レースなど)を実行できるマルチタスク強化学習フレームワークを提案した。
原題: Multi-Task Reinforcement Learning for Quadrotors / Jiaxu Xing, Ismail Geles, Yunlong Song 他
日本語で読む → - 論文オフライン強化学習機械学習
M³PC:事前学習済みマスク付き軌道モデルのためのテスト時モデル予測制御
マスク付き自己符号化で事前学習した軌道モデルを、推論時にモデル予測制御(MPC)で活用し、追加学習なしで意思決定性能を向上させる手法を提案。
原題: M$^3$PC: Test-time Model Predictive Control for Pretrained Masked Trajectory Model / Kehan Wen, Yutong Hu, Yao Mu 他
日本語で読む → - 論文強化学習/好奇心ロボティクス
動的神経好奇心が自律的目標発見のための学習柔軟性を高める
青斑核-ノルアドレナリン系に着想を得た動的神経場モデルで好奇心と注意を統合し、ロボットアームが物体を押す多様な目標を自律的に発見・学習する手法を提案。
原題: Dynamic Neural Curiosity Enhances Learning Flexibility for Autonomous Goal Discovery / Quentin Houbre, Roel Pieters
日本語で読む → - 論文強化学習機械学習
MaxInfoRL:情報利得最大化による強化学習の探索促進
情報利得を内在的報酬として最大化し、価値関数と状態・報酬・行動のエントロピーを自然にトレードオフする探索フレームワークを提案。連続状態行動空間のオフポリシーRLに適用し、困難な探索問題や視覚制御タスクで性能向上を実現。
原題: MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization / Bhavya Sukhija, Stelian Coros, Andreas Krause 他
日本語で読む → - 論文オフライン強化学習機械学習
AdaCred: 特徴量クレジット付き適応的因果決定トランスフォーマー
短い行動・報酬・状態系列から因果グラフを構築し、重要度の低い表現を枝刈りしながら適応的に制御方策を学習する手法を提案。オフライン強化学習と模倣学習で従来法を上回る性能を示した。
原題: AdaCred: Adaptive Causal Decision Transformers with Feature Crediting / Hemant Kumawat, Saibal Mukhopadhyay
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習のための目標条件付きデータ拡張
オフライン強化学習において、リターン指向の目標条件を組み込んだ拡散モデルにより、高品質なデータを生成してデータセットを拡張する手法GODAを提案した。
原題: Goal-Conditioned Data Augmentation for Offline Reinforcement Learning / Xingshuai Huang, Di Wu, Benoit Boulet
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
深層ニューラルネットワークによるマルチ航空宇宙システムのピックアンドプレースタスクのための最適化協調戦略
深層強化学習を用いてマルチエージェント航空宇宙システムの協調制御を最適化し、物体移動タスクの効率を最大16%向上させた。
原題: Optimized Coordination Strategy for Multi-Aerospace Systems in Pick-and-Place Tasks By Deep Neural Network / Ye Zhang, Linyue Chu, Letian Xu 他
日本語で読む → - 論文強化学習/計画ロボティクス
強化学習と計画のための同変アクションサンプリング
ロボット操作などの対称性を持つ連続制御タスクにおいて、サンプリングベースの行動選択に同変性を導入し、MPPI計画法に適用することで効率と性能を向上させる手法を提案した。
原題: Equivariant Action Sampling for Reinforcement Learning and Planning / Linfeng Zhao, Owen Howell, Xupeng Zhu 他
日本語で読む → - 論文安全強化学習ロボティクス
ナビゲーションタスクの安全で効率的な強化学習のための動的安全シールド
最適化ベース制御器の堅牢性と強化学習エージェントの長期予測能力を組み合わせ、エージェントが制御器のパラメータを適応的に調整できる新しい安全シールドを提案し、衝突を抑えつつ探索を改善する。
原題: A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks / Murad Dawood, Ahmed Shokry, Maren Bennewitz
日本語で読む →