論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/3/19 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自己教師あり強化学習機械学習
自己教師あり強化学習のための1000層ネットワーク:深さのスケーリングが新たな目標到達能力を可能にする
自己教師あり強化学習において、ネットワークを最大1024層まで深くすることで、目標到達タスクの成功率が2倍から50倍に向上し、学習される行動も質的に変化することを示した。
原題: 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities / Kevin Wang, Ishaan Javali, Michał Bortkiewicz 他
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習のための行動選好回帰
ペア比較に基づく選好最適化をオフライン強化学習に応用し、Q関数の最大モードを行動方策との整合性を保ちながら学習するBPRを提案。D4RLやV-D4RLで最先端性能を達成。
原題: Behavior Preference Regression for Offline Reinforcement Learning / Padmanaba Srinivasan, William Knottenbelt
日本語で読む → - 論文自動運転/強化学習ロボティクス
交差点走行の安全性を高めるリスク認識型強化学習
自動運転の交差点通過において、リスクを評価する安全クリティックと注意機構を組み合わせた強化学習手法を提案し、衝突率の低減と通過効率の向上を実現した。
原題: Risk-Aware Reinforcement Learning for Autonomous Driving: Improving Safety When Driving through Intersection / Bo Leng, Ran Yu, Wei Han 他
日本語で読む → - 論文安全強化学習ロボティクス
安全なロボット基盤モデルに向けて
汎用ロボット方策の行動空間を安全制約するレイヤーをATACOMの拡張により実現し、エアホッケー環境で衝突回避を実証した。
原題: Towards Safe Robot Foundation Models / Maximilian Tölle, Theo Gruner, Daniel Palenicek 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
マルチエージェント逆Q学習による模倣学習
他エージェントの方策で周辺化したクリティックを学習し、単一エージェントのsoft-Q IRLの最適化基準を適用することで、マルチエージェントの逆強化学習を高効率化した手法MAMQLを提案。
原題: Multi-Agent Inverse Q-Learning from Demonstrations / Nathaniel Haynam, Adam Khoja, Dhruv Kumar 他
日本語で読む → - 論文強化学習ロボティクス
因果関係に基づく多段階ロボットタスクの強化学習手法
ロボットが行動と報酬の因果関係を自動発見し、因果的行動のみで行動空間を構成することで、多段階タスクにおける冗長な探索や手戻りを抑える強化学習手法を提案した。
原題: Causality-Based Reinforcement Learning Method for Multi-Stage Robotic Tasks / Jiechao Deng, Ning Tan
日本語で読む → - 論文強化学習ロボティクス
報酬の補助輪:ロボティクス強化学習のための適応的補助報酬
教師-生徒フレームワークにより、ロボットの学習進度に応じて補助報酬の重みを動的に調整し、人手設計の報酬を上回る性能と学習効率を実現した。
原題: Reward Training Wheels: Adaptive Auxiliary Rewards for Robotics Reinforcement Learning / Linji Wang, Tong Xu, Yuanjie Lu 他
日本語で読む → - 論文強化学習ロボティクス
非定常環境における空中ロボット制御のための強化学習の可塑性維持:コスト認識フレームワーク
強化学習の長期学習で生じる可塑性喪失を防ぐため、報酬と損失のバランスを取る回顧的コスト機構(RECOM)を提案し、風擾乱下でのホバリング制御でポリシー崩壊を回避した。
原題: Maintaining Plasticity in Reinforcement Learning: A Cost-Aware Framework for Aerial Robot Control in Non-stationary Environments / Ali Tahir Karasahin, Ziniu Wu, Basaran Bahadir Kocer
日本語で読む → - 論文強化学習機械学習
ガウス過程尤度推定による報酬再分配
ガウス過程で報酬関数をモデル化し、軌跡全体の尤度最大化により疎な報酬を密な報酬に再分配する手法を提案。MuJoCoベンチマークでサンプル効率と性能が向上。
原題: Reward Redistribution via Gaussian Process Likelihood Estimation / Minheng Xiao, Xian Yu
日本語で読む → - 論文強化学習ロボティクス
強化学習に基づくロボットの無秩序ターゲット知的認識に関する研究と設計
複雑環境下での無秩序なターゲット認識精度向上のため、バイラテラルフィルタで画像を照明・反射成分に分解して強調・融合し、深層強化学習で認識する手法を提案した。
原題: Research and Design on Intelligent Recognition of Unordered Targets for Robots Based on Reinforcement Learning / Yiting Mao, Dajun Tao, Shengyuan Zhang 他
日本語で読む → - 論文オフライン強化学習機械学習
マルチゲーム決定トランスフォーマーのための目標リターン最適化
オフラインデータのみからゲームごとの目標リターンを自動設定するMTROを提案し、マルチゲーム決定トランスフォーマーの性能を追加学習なしで向上させた。
原題: Target Return Optimizer for Multi-Game Decision Transformer / Kensuke Tatematsu, Akifumi Wachi
日本語で読む → - 論文外骨格/強化学習ロボティクス
痙縮条件下における外骨格の強化学習による適応トルク制御
脳性麻痺や脊髄損傷などによる痙縮を持つ人向けに、深層強化学習を用いて膝外骨格の適応トルク制御器を開発し、シミュレーションで従来のコンプライアント制御より最大トルクと振動を低減できることを示した。
原題: Adaptive Torque Control of Exoskeletons under Spasticity Conditions via Reinforcement Learning / Andrés Chavarrías, David Rodriguez-Cianca, Pablo Lanillos
日本語で読む → - 論文強化学習機械学習
マルチフィデリティ制御変数による方策勾配推定
高忠実度データが乏しい状況で、低忠実度シミュレータのデータを制御変数として活用し、分散を低減した不偏な方策勾配推定器を構築するマルチフィデリティ強化学習フレームワークを提案。
原題: A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation / Xinjie Liu, Cyrus Neary, Kushagra Gupta 他
日本語で読む → - 論文強化学習/製造応用ロボティクス
強化学習によるレンズシステムの能動的アライメント
強化学習を用いて、製造公差やノイズがある実環境でも高精度・高速・ロバストにレンズと撮像素子の位置合わせを行う手法を提案し、物理ベースのオープンソースシミュレータrelignを公開した。
原題: Active Alignments of Lens Systems with Reinforcement Learning / Matthias Burkhardt, Tobias Schmähling, Pascal Stegmann 他
日本語で読む → - 論文強化学習/部分観測/記憶機械学習
部分観測下の強化学習における記憶の分析ツールとPOPGym Arcade
部分観測環境でエージェントが記憶をどう使うかを分析するツールと、完全観測/部分観測の対照実験が可能なAtari風ベンチマークPOPGym Arcadeを提案し、価値関数が無関係な履歴にクレジットを拡散する問題を明らかにした。
原題: Investigating Memory in Model-Free RL with POPGym Arcade / Zekang Wang, Zhe He, Borong Zhang 他
日本語で読む → - 論文強化学習/センサ管理ロボティクス
Stone Soupマルチターゲット追跡特徴抽出による深層強化学習環境での自律探索・追跡
Stone Soup追跡フレームワークを特徴抽出器としてGymnasium環境に組み込み、センサ管理タスクの強化学習エージェントを訓練する手法を提案し、探索・追跡シナリオで単純な方策を上回ることを示した。
原題: Stone Soup Multi-Target Tracking Feature Extraction For Autonomous Search And Track In Deep Reinforcement Learning Environment / Jan-Hendrik Ewers, Joe Gibbs, David Anderson
日本語で読む → - 論文モデルベース強化学習機械学習
ブートストラップ型モデル予測制御
MPCの専門家を模倣する方策学習とモデルベースTD学習を組み合わせ、MPC自体をブートストラップ的に改善する連続制御アルゴリズムを提案した。
原題: Bootstrapped Model Predictive Control / Yuhang Wang, Hanwei Guo, Sizhe Wang 他
日本語で読む → - 論文強化学習/制御ロボティクス
極限海況下のAUVのためのLLM強化RLベース適応S面制御器
LLMを用いて強化学習の報酬関数と制御器パラメータを同時最適化し、極限海況下でのAUVの適応的なS面制御を実現した研究。
原題: Never too Prim to Swim: An LLM-Enhanced RL-based Adaptive S-Surface Controller for AUVs under Extreme Sea Conditions / Guanwen Xie, Jingzehua Xu, Yimian Ding 他
日本語で読む → - 論文強化学習機械学習
充足優先度論理による意図と行動のギャップの解消
複数の競合する目的を持つ強化学習において、意図と優先度を論理式で記述する充足優先度論理(FPL)を提案し、非線形効用スカラー化を実現するBalanced Policy Gradientを開発した。
原題: Closing the Intent-to-Behavior Gap via Fulfillment Priority Logic / Bassel El Mabsout, Abdelrahman Abdelgawad, Renato Mancuso
日本語で読む → - 論文安全強化学習ロボティクス
接触リッチなロボットタスクのための受動性中心の安全強化学習
接触を伴うロボットタスクにおいて、強化学習方策に受動性制約を導入し、訓練時と展開時の両方で安全性と安定性を確保する手法を提案した。
原題: Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks / Heng Zhang, Gokhan Solak, Sebastian Hjorth 他
日本語で読む → - 論文飛行制御/強化学習制御
スケール対応深層強化学習による動特性不変なクアッドロータ制御
力・トルク入力を直接最適化し、機体スケールやペイロード変動に適応する深層強化学習フレームワークを提案。30g〜2.1kgの機体で安定飛行を実現し、実機200回以上の飛行で風外乱や揺動ペイロードに対応した。
原題: Dynamics-Invariant Quadrotor Control using Scale-Aware Deep Reinforcement Learning / Varad Vaidya, Jishnu Keshavan
日本語で読む → - 論文モデルベース強化学習機械学習
微分可能情報を活用したモデルベース強化学習の強化
微分可能環境の情報を活用し、Sobolev損失でモデル予測精度を高め、混合長さの切り詰め学習で方策勾配の分散を抑えるMBRL手法MB-MIXを提案。ヒューマノイド制御や変形物体操作で既存手法を上回る。
原題: Differentiable Information Enhanced Model-Based Reinforcement Learning / Xiaoyuan Zhang, Xinyan Cai, Bo Liu 他
日本語で読む → - 論文モデルベース強化学習/自動運転ロボティクス
InDRiVE: 好奇心駆動型汎用世界モデルによる車両探索のための内在的不一致ベース強化学習
Dreamerベースのモデルベース強化学習に、世界モデルのアンサンブル間の不一致を利用した純粋な内在的報酬を導入し、タスク非依存の表現を学習して車線追従や衝突回避などの運転タスクへゼロショット/少数ショット適応を可能にした研究。
原題: InDRiVE: Intrinsic Disagreement based Reinforcement for Vehicle Exploration through Curiosity Driven Generalized World Model / Feeza Khan Khanzada, Jaerock Kwon
日本語で読む → - 論文跳躍/強化学習ロボティクス
剛体および関節型ソフト四足ロボットの爆発的跳躍:模範誘導強化学習による実現
モデルベース軌道最適化による粗い跳躍例を模倣した深層強化学習で、剛体と並列弾性を備えた四足ロボットに多様な跳躍を学習させ、着地誤差・エネルギー・ピークトルクを低減しつつ不整地への頑健性を実現した。
原題: Explosive Jumping with Rigid and Articulated Soft Quadrupeds via Example Guided Reinforcement Learning / Georgios Apostolides, Wei Pan, Jens Kober 他
日本語で読む → - 論文安全強化学習/自動運転ロボティクス
人間のリスク選好に整合した安全強化学習による密集交通での高速道路合流
ユーザのリスク選好を制約付きMDPの安全制約に組み込み、ファジィ制御で制約のコスト上限を調整し、MPCによる行動シールドで安全でない行動を除去する合流意思決定手法を提案した。
原題: Human-aligned Safe Reinforcement Learning for Highway On-Ramp Merging in Dense Traffic / Yang Li, Shijie Yuan, Yuan Chang 他
日本語で読む → - 論文自動運転/強化学習機械学習
V-Max: 自動運転のための強化学習フレームワーク
自動運転の意思決定に強化学習を実用的に適用するためのオープンな研究フレームワークV-Maxを提案し、大規模実験を可能にするシミュレータ上で多様なデータセットの高速シミュレーションを実現した。
原題: V-Max: A Reinforcement Learning Framework for Autonomous Driving / Valentin Charraut, Waël Doulazmi, Thomas Tournaire 他
日本語で読む → - 論文水中ロボティクス/強化学習ロボティクス
MarineGym:水中ロボティクス向け高性能強化学習プラットフォーム
水中ロボット向けにIsaac SimベースのGPU加速流体力学プラグインを統合し、単一GPUで毎秒25万フレームの高速学習を実現する強化学習プラットフォームを提案。
原題: MarineGym: A High-Performance Reinforcement Learning Platform for Underwater Robotics / Shuguang Chu, Zebin Huang, Yutong Li 他
日本語で読む → - 論文強化学習機械学習
進化的方策最適化
進化的アルゴリズムのスケーラビリティと方策勾配の安定性を組み合わせたハイブリッド強化学習手法EPOを提案し、巧みな操作や歩行タスクで性能を向上させた。
原題: Evolutionary Policy Optimization / Jianren Wang, Yifan Su, Abhinav Gupta 他
日本語で読む → - 論文マルチエージェント強化学習機械学習
PEnGUiN: サンプル効率の高いマルチエージェント強化学習のための部分的同変グラフニューラルネットワーク
実環境に存在する非対称性に対応するため、部分的な同変性を扱えるグラフニューラルネットワークPEnGUiNを提案し、非対称なマルチエージェント強化学習タスクで従来手法より優れることを示した。
原題: PEnGUiN: Partially Equivariant Graph NeUral Networks for Sample Efficient MARL / Joshua McClellan, Greyson Brothers, Furong Huang 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
協調型マルチエージェント強化学習のための因子化深層Qネットワークによる被災者タグ付け
大規模災害時の被災者タグ付けを迅速化するため、マルチエージェント強化学習(因子化深層Qネットワーク)を適用し、従来のヒューリスティクスと比較評価した。
原題: Factorized Deep Q-Network for Cooperative Multi-Agent Reinforcement Learning in Victim Tagging / Maria Ana Cardei, Afsaneh Doryab
日本語で読む →