論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
残差報酬モデルによる選好ベース強化学習
選好ベース強化学習において、事前知識の報酬と学習した報酬を足し合わせる残差報酬モデルを提案し、収束速度と性能を改善した。
原題: Residual Reward Models for Preference-based Reinforcement Learning / Chenyang Cao, Miguel Rogel-García, Mohamed Nabail 他
日本語で読む → - 論文強化学習ロボティクス
実行誤差を考慮した制御最適化深層強化学習フレームワーク
強化学習において行動実行時の誤差や制御補正を明示的にモデル化し、二段階の行動選択と制御信号決定を統合して学習する枠組みを提案。実世界の不確実性下でも堅牢な意思決定を可能にする。
原題: Control-Optimized Deep Reinforcement Learning for Artificially Intelligent Autonomous Systems / Oren Fivel, Matan Rudman, Kobi Cohen
日本語で読む → - 論文強化学習ロボティクス
進化戦略による深層強化学習方策の微調整:劣駆動ロボット制御への応用
深層強化学習で訓練した方策を進化戦略(SNES)で微調整し、劣駆動ロボットの制御性能とロバスト性を向上させる手法を提案した論文。
原題: Finetuning Deep Reinforcement Learning Policies with Evolutionary Strategies for Control of Underactuated Robots / Marco Calì, Alberto Sinigaglia, Niccolò Turcato 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
CoMoCAVs: マルチポリシー強化学習による連結自動運転車の意思決定誘導型動作計画
高速道路の車線選択と制御指令生成を、Mixture of Experts風のゲーティング機構とマルチポリシー強化学習で統合し、状況に応じて専門サブネットワークを切り替えるCDGMPフレームワークを提案した。
原題: CoMoCAVs: Cohesive Decision-Guided Motion Planning for Connected and Autonomous Vehicles with Multi-Policy Reinforcement Learning / Pan Hu
日本語で読む → - 論文強化学習機械学習
不確実性を考慮した報酬設計プロセス
大規模言語モデルと不確実性推定を組み合わせ、強化学習の報酬関数設計を効率化するフレームワークURDPを提案。
原題: Uncertainty-aware Reward Design Process / Yang Yang, Xiaolu Zhou, Bosong Ding 他
日本語で読む → - 論文強化学習ロボティクス
四足ロボットの全方向3Dジャンプのための誘導強化学習
ベジェ曲線と等加速度直線運動モデルを組み合わせて物理的直感を活用し、四足ロボットの全方向3Dジャンプを効率的かつ説明可能に学習する誘導強化学習手法を提案。
原題: Guided Reinforcement Learning for Omnidirectional 3D Jumping in Quadruped Robots / Riccardo Bussola, Michele Focchi, Giulio Turrisi 他
日本語で読む → - 論文強化学習機械学習
フローマッチング方策勾配
フローマッチングを方策勾配法に統合したFPOを提案し、拡散スタイルの方策を連続制御タスクで学習できることを示した。
原題: Flow Matching Policy Gradients / David McAllister, Songwei Ge, Brent Yi 他
日本語で読む → - 論文制御/強化学習ロボティクス
深層強化学習による宇宙機リアクションホイール姿勢制御の知的制御
TD3にHindsight Experience ReplayとDimension Wise Clippingを組み合わせたTD3-HDを提案し、リアクションホイール故障時でも衛星姿勢制御の耐故障性と適応性を向上させる。
原題: Intelligent Control of Spacecraft Reaction Wheel Attitude Using Deep Reinforcement Learning / Ghaith El-Dalahmeh, Mohammad Reza Jabbarpour, Bao Quoc Vo 他
日本語で読む → - 論文強化学習機械学習
補助開始状態分布を用いたオンライン強化学習の加速
少数の専門家デモと任意の状態にリセット可能なシミュレータを活用し、安全概念に基づく補助開始状態分布でオンライン強化学習のサンプル効率を大幅に改善した。
原題: Accelerated Online Reinforcement Learning using Auxiliary Start State Distributions / Aman Mehra, Alexandre Capone, Jeff Schneider
日本語で読む → - 論文マルチタスク強化学習ロボティクス
ロボティクス向け大規模並列マルチタスク強化学習のベンチマーク
GPU加速シミュレータIsaacGym上で50の操作タスクと20の歩行タスクからなるマルチタスク強化学習ベンチマークMTBenchを構築し、複数のアルゴリズムを統一的に評価した。
原題: Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks / Viraj Joshi, Zifan Xu, Bo Liu 他
日本語で読む → - 論文強化学習ロボティクス
同変目標条件付きコントラスティブ強化学習
目標条件付き操作タスクの回転対称性を活用し、同変制約を導入したコントラスティブ強化学習を提案。サンプル効率と空間汎化を改善し、オフライン設定にも拡張。
原題: Equivariant Goal Conditioned Contrastive Reinforcement Learning / Arsh Tangri, Nichols Crawford Taylor, Haojie Huang 他
日本語で読む → - 論文強化学習/水中ロボティクスロボティクス
Ocean Diviner: 拡散モデル強化強化学習によるAUVの堅牢な水中制御フレームワーク
拡散モデルで実現可能な行動を生成し強化学習と組み合わせることで、動的で不確実な水中環境におけるAUVの制御を高精度かつ堅牢にする手法を提案した。
原題: Ocean Diviner: A Diffusion-Augmented Reinforcement Learning Framework for AUV Robust Control in Underwater Tasks / Jingzehua Xu, Guanwen Xie, Weiyi Liu 他
日本語で読む → - 論文強化学習ロボティクス
連続制御へのグループ相対方策最適化の拡張:ロボット強化学習のための理論的枠組み
GRPOを連続行動空間に拡張する理論的枠組みを提案し、軌道ベースの方策クラスタリングや状態認識型アドバンテージ推定を導入してロボットタスクへの適用可能性を示した。
原題: Extending Group Relative Policy Optimization to Continuous Control: A Theoretical Framework for Robotic Reinforcement Learning / Rajat Khanda, Mohammad Baqar, Sambuddha Chakrabarti 他
日本語で読む → - 論文経路計画/強化学習ロボティクス
都市航空モビリティのためのリアルタイム通信考慮型ライドシェア経路計画:マルチソースハイブリッド注意強化学習アプローチ
都市航空モビリティにおいて、通信品質を考慮しつつリアルタイムなライドシェア要求に応える経路計画を、マルチソースハイブリッド注意強化学習で実現する手法を提案した。
原題: Real-Time Communication-Aware Ride-Sharing Route Planning for Urban Air Mobility: A Multi-Source Hybrid Attention Reinforcement Learning Approach / Yuejiao Xie, Maonan Wang, Di Zhou 他
日本語で読む → - 論文強化学習機械学習
深層強化学習ネットワークのオンライン訓練とプルーニング
強化学習の特徴抽出ネットワーク(OFENet)を対象に、訓練とプルーニングを同時に行う手法を提案し、計算・メモリコストを削減する。
原題: Online Training and Pruning of Deep Reinforcement Learning Networks / Valentin Frank Ingmar Guenter, Athanasios Sideris
日本語で読む → - 論文オフライン強化学習/計画AI
一貫性軌道計画:オフラインモデルベース強化学習のための高品質で効率的な軌道最適化
拡散モデルベースの計画における計算コスト問題を解決するため、Consistency Trajectory Modelを活用した一貫性軌道計画(CTP)を提案。D4RLベンチマークで既存手法を上回り、120倍以上の推論高速化を実現した。
原題: Consistency Trajectory Planning: High-Quality and Efficient Trajectory Optimization for Offline Model-Based Reinforcement Learning / Guanquan Wang, Takuya Hiraoka, Yoshimasa Tsuruoka
日本語で読む → - 論文マルチエージェント強化学習AI
生成AIベースのマルチエージェント強化学習:分散エージェント知能に向けた生成的RLエージェントの視点
マルチエージェント強化学習において、生成AIを活用してエージェントを生成モデルとして再定義し、反応的から先制的な意思決定へのパラダイムシフトを提唱する。
原題: GenAI-based Multi-Agent Reinforcement Learning towards Distributed Agent Intelligence: A Generative-RL Agent Perspective / Hang Wang, Junshan Zhang
日本語で読む → - 論文強化学習/SNNAI
スパイキングニューラルネットワークとメトロポリス・ヘイスティングスサンプリングによる動的エージェントの制御学習
勾配法を使わずメトロポリス・ヘイスティングスサンプリングでスパイキングニューラルネットワークを強化学習により訓練し、動的エージェント制御を実現するフレームワークを提案した。
原題: Learning to Control Dynamical Agents via Spiking Neural Networks and Metropolis-Hastings Sampling / Ali Safa, Farida Mohsen, Ali Al-Zawqari
日本語で読む → - 論文強化学習/衛星制御制御
信頼されるオンボードAIに向けて:強化学習による小型衛星運用の高度化
3U CubeSatのオンボードエージェントに強化学習を適用し、テレメトリに基づくマクロ制御行動を生成して姿勢制御などを自動化する手法を開発。デジタルツイン上で訓練し、信頼性構築を目指す。
原題: Toward Trusted Onboard AI: Advancing Small Satellite Operations using Reinforcement Learning / Cannon Whitney, Joseph Melville
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
スキルグラフによるマルチタスク・マルチエージェント強化学習
無関係なタスクを含むマルチタスク・マルチエージェント強化学習に対し、上位層にスキルグラフ、下位層に標準MARLを用いる階層的手法を提案し、知識転移能力を高めた。
原題: Multi-Task Multi-Agent Reinforcement Learning via Skill Graphs / Guobin Zhu, Rui Zhou, Wenkang Ji 他
日本語で読む → - 論文強化学習ロボティクス
CueLearner: 相対フィードバックによるブートストラップと局所的な方策適応
「もっと左に」のような相対的な人間フィードバックをオフポリシー強化学習と組み合わせ、スパース報酬タスクの探索効率向上や環境・選好変化への適応を実現する手法を提案。
原題: CueLearner: Bootstrapping and local policy adaptation from relative feedback / Giulio Schiavi, Andrei Cramariuc, Lionel Ott 他
日本語で読む → - 論文マルチエージェント強化学習AI
Assistax: 支援ロボティクス向けマルチエージェント・ハードウェア加速強化学習ベンチマーク
JAXとMuJoCo-MJX上でGPU加速された支援ロボティクスタスク群を提供し、人間役のヒューマノイドエージェントとロボットをマルチエージェント強化学習で共訓練できるベンチマークを構築した。
原題: Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics / Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius 他
日本語で読む → - 論文強化学習機械学習
アクションチャンキングを用いた強化学習
将来の行動列をまとめて予測するアクションチャンキングをTDベースの強化学習に導入し、長期的で報酬が疎なタスクにおける探索とサンプル効率を改善するQ-chunkingを提案した。
原題: Reinforcement Learning with Action Chunking / Qiyang Li, Zhiyuan Zhou, Sergey Levine
日本語で読む → - 論文逆強化学習機械学習
SPLASH! 劣悪な階層的デモンストレーションからの長期的敵対的タスクに対するサンプル効率の良い選好ベース逆強化学習
劣悪なデモンストレーションから長期的・敵対的タスクを学習する逆強化学習手法SPLASHを提案し、シミュレーションと実世界の無人水上艇で有効性を示した。
原題: SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations / Peter Crowley, Zachary Serlin, Tyler Paine 他
日本語で読む → - 論文強化学習機械学習
重み正規化によるCrossQのスケーリング
強化学習手法CrossQに重み正規化を導入し、高いUTD比でも安定して学習できるようにしてサンプル効率を改善した研究。
原題: Scaling CrossQ with Weight Normalization / Daniel Palenicek, Florian Vogt, Jan Peters
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
通信を活用した自律走行車のためのロバストで安全なマルチエージェント強化学習:シミュレーションからハードウェアまで
V2V通信を活用したマルチエージェント強化学習フレームワークRSR-RSMARLを提案し、シミュレーションから実機へのゼロショット転移と制御バリア関数による安全性保証を実現した。
原題: Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware / Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad 他
日本語で読む → - 論文自動運転/強化学習機械学習
乳児の睡眠を最適化する自動運転:ウェアラブルセンシングと車両センシングを融合したインテリジェントクルーズコントロール
ウェアラブルセンサと車両データを統合し、強化学習で運転の攻撃性を動的に調整することで、乳児の睡眠品質を向上させる自動運転クルーズコントロールを提案した。
原題: Towards Infant Sleep-Optimized Driving: Synergizing Wearable and Vehicle Sensing in Intelligent Cruise Control / Ruitao Chen, Mozhang Guo, Jinge Li
日本語で読む → - 論文強化学習/ロバスト制御機械学習
ARMOR: 物理攻撃下のUAVのための堅牢な強化学習ベース制御
GPSスプーフィングなどの物理攻撃に耐えるUAV制御のため、特権情報で訓練した教師エンコーダから攻撃に強い潜在表現を学習し、履歴センサデータのみで展開可能な学生エンコーダを訓練する強化学習手法を提案。
原題: ARMOR: Robust Reinforcement Learning-based Control for UAVs under Physical Attacks / Pritam Dash, Ethan Chan, Nathan P. Lawrence 他
日本語で読む → - 論文強化学習ロボティクス
AURA: 検索拡張エージェントによる自律的スキルアップ
LLMを活用して強化学習カリキュラムを自動設計し、ユーザープロンプトからヒューマノイドロボットのポリシーをゼロショットで学習・展開するフレームワークを提案。
原題: AURA: Autonomous Upskilling with Retrieval-Augmented Agents / Alvin Zhu, Yusuke Tanaka, Andrew Goldberg 他
日本語で読む → - 論文選好ベース強化学習ロボティクス
SENIOR: 選好ベース強化学習における効率的なクエリ選択と選好誘導探索
人間の選好から報酬を学習する強化学習において、比較しやすい動作区間を選ぶクエリ選択法と選好に基づく探索手法を組み合わせ、フィードバック効率と方策学習を改善した。
原題: SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning / Hexian Ni, Tao Lu, Haoyuan Hu 他
日本語で読む →