論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文モデルベース強化学習機械学習
M3PO: 大規模マルチタスクモデルベース方策最適化
観測再構成を不要とする暗黙的世界モデルと、モデルベース計画とモデルフリーの不確実性ボーナスを組み合わせた探索戦略により、マルチタスク強化学習のサンプル効率と汎化性能を向上させる手法を提案。
原題: M3PO: Massively Multi-Task Model-Based Policy Optimization / Aditya Narendra, Dmitry Makarov, Aleksandr Panov
日本語で読む → - 論文マイクロロボティクス/強化学習ロボティクス
深層強化学習による3リンクマイクロスイマーのナビゲーション
低レイノルズ数環境で3リンクマイクロスイマーのストロークパターンを深層強化学習で設計し、速度重視とエネルギー考慮の2戦略を比較して適応的なナビゲーションを実現した。
原題: Navigation of a Three-Link Microswimmer via Deep Reinforcement Learning / Yuyang Lai, Sina Heydari, On Shun Pak 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
通信を活用した自律走行車のためのロバストで安全なマルチエージェント強化学習:シミュレーションからハードウェアまで
V2V通信を活用したマルチエージェント強化学習フレームワークRSR-RSMARLを提案し、シミュレーションから実機へのゼロショット転移と制御バリア関数による安全性保証を実現した。
原題: Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware / Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad 他
日本語で読む → - 論文強化学習/形式仕様機械学習
微分可能シミュレーションを用いた線形時相論理による学習の加速
線形時相論理(LTL)と微分可能シミュレータを統合し、形式仕様から直接勾配ベースで学習できる初のエンドツーエンド枠組みを提案。接触の多い連続制御タスクで学習を大幅に加速し、離散ベースラインの最大2倍のリターンを達成した。
原題: Accelerated Learning with Linear Temporal Logic using Differentiable Simulation / Alper Kamil Bozkurt, Calin Belta, Ming C. Lin
日本語で読む → - 論文モデルベース強化学習ロボティクス
テスト時観測介入による再想像:視覚モデル予測制御のための妨害物に頑健な世界モデル予測
世界モデルが未知の視覚的妨害物に弱い問題に対し、テスト時に妨害物を検出・除去して予測を再想像し、事後的に妨害物を戻すことで、行動検証を頑健にする手法を提案。
原題: Reimagination with Test-time Observation Interventions: Distractor-Robust World Model Predictions for Visual Model Predictive Control / Yuxin Chen, Jianglan Wei, Chenfeng Xu 他
日本語で読む → - 論文強化学習/ロバスト制御機械学習
ARMOR: 物理攻撃下のUAVのための堅牢な強化学習ベース制御
GPSスプーフィングなどの物理攻撃に耐えるUAV制御のため、特権情報で訓練した教師エンコーダから攻撃に強い潜在表現を学習し、履歴センサデータのみで展開可能な学生エンコーダを訓練する強化学習手法を提案。
原題: ARMOR: Robust Reinforcement Learning-based Control for UAVs under Physical Attacks / Pritam Dash, Ethan Chan, Nathan P. Lawrence 他
日本語で読む → - 論文強化学習/安全制御機械学習
リスク感応型行動価値反復と分位点回帰による安全志向強化学習制御
CVaRを用いたリスク正則化分位点ベース強化学習を提案し、動的環境での移動ロボット制御において衝突を減らし目標達成率を向上させる。
原題: Safety-Aware Reinforcement Learning for Control via Risk-Sensitive Action-Value Iteration and Quantile Regression / Clinton Enwerem, Aniruddh G. Puranic, John S. Baras 他
日本語で読む → - 論文安全強化学習/運動計画ロボティクス
予測安全フィルタを統合した安全強化学習によるドリフト車両の運動計画と制御
強化学習エージェントとモデルベースのドリフトダイナミクスを組み合わせ、予測安全フィルタでオンラインに行動を調整することで、安全かつ効率的な自律ドリフト運動計画を実現した研究。
原題: Safe Reinforcement Learning with a Predictive Safety Filter for Motion Planning and Control: A Drifting Vehicle Example / Bei Zhou, Baha Zarrouki, Mattia Piccinini 他
日本語で読む → - 論文強化学習機械学習
オンライン強化学習におけるベルマン最適作用素からベルマン作用素への段階的遷移
連続行動空間のアクター・クリティック強化学習において、ベルマン最適作用素を徐々にベルマン作用素へと切り替えるアニーリング手法を提案し、学習加速と過大評価バイアスの抑制を両立させた。
原題: Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning / Motoki Omura, Kazuki Ota, Takayuki Osa 他
日本語で読む → - 論文オフライン強化学習機械学習
グラフ支援スティッチングによるオフライン階層強化学習
サブゴール選択をグラフ探索問題として定式化し、異なる軌跡の状態を統合して効率的に遷移を接続するオフライン階層強化学習フレームワークを提案。
原題: Graph-Assisted Stitching for Offline Hierarchical Reinforcement Learning / Seungho Baek, Taegeon Park, Jongchan Park 他
日本語で読む → - 論文強化学習/群制御ロボティクス
追跡回避ゲームにおける俊敏なクアッドロータのための学習制御器
強化学習で1対1のクアッドロータ追跡回避を訓練する際の非定常性や破滅的忘却に対処するため、PSROに基づく非同期多段階集団ベース訓練法AMSPBHを提案し、多様な戦略への汎化と新戦略の発見を実現した。
原題: Learned Controllers for Agile Quadrotors in Pursuit-Evasion Games / Alejandro Sanchez Roncero, Yixi Cai, Olov Andersson 他
日本語で読む → - 論文メタ強化学習機械学習
条件付きニューラルプロセスを用いた教師なしメタテストによるハイブリッドメタ強化学習
報酬がメタテスト時に得られない設定で、条件付きニューラルプロセスを活用してタスク推論を行い、少ないサンプルで未知タスクに適応するハイブリッドメタ強化学習手法を提案した。
原題: Unsupervised Meta-Testing with Conditional Neural Processes for Hybrid Meta-Reinforcement Learning / Suzan Ece Ada, Emre Ugur
日本語で読む → - 論文強化学習機械学習
不確かさ推定で残差強化学習を加速する
ベース方策の不確かさを利用して探索を効率化し、確率的なベース方策にも対応できる残差強化学習手法を提案。シミュレーションと実機で既存手法を上回る性能を示した。
原題: Accelerating Residual Reinforcement Learning with Uncertainty Estimation / Lakshita Dodeja, Karl Schmeckpeper, Shivam Vats 他
日本語で読む → - 論文交通最適化/強化学習機械学習
安全優先の強化学習による3D都市規模交通流最適化
Unity製の3D都市交通シミュレータと衝突モデルを構築し、安全を優先する報酬設計の強化学習(PPO)で衝突・走行距離・排出量を大幅削減できることを示した。
原題: Safety-Prioritized, Reinforcement Learning-Enabled Traffic Flow Optimization in a 3D City-Wide Simulation Environment / Mira Nuthakki
日本語で読む → - 論文強化学習機械学習
観測不能なランダム遅延に適応する強化学習
エージェントと環境間の観測不能で時変な遅延に対処するため、将来の行動候補行列を生成するinteraction layerを導入し、遅延パターンに動的に適応するモデルベース強化学習アルゴリズムACDAを提案した。
原題: Adaptive Reinforcement Learning for Unobservable Random Delays / John Wikman, Alexandre Proutiere, David Broman
日本語で読む → - 論文選好ベース強化学習機械学習
効率的な選好ベース強化学習:ランダム化探索と実験計画法の融合
人間の選好比較から報酬を学習する強化学習において、ランダム化探索と最適実験計画法を組み合わせ、少ないクエリで効率的に学習する手法を提案した。
原題: Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design / Andreas Schlaginhaufen, Reda Ouhamma, Maryam Kamgarpour
日本語で読む → - 論文安全強化学習機械学習
解析的勾配を用いた証明可能安全な強化学習
解析的勾配ベースの強化学習に初めての安全保証機構を導入し、微分可能なシミュレータと統合して性能を損なわずに安全な訓練を実現した。
原題: Leveraging Analytic Gradients in Provably Safe Reinforcement Learning / Tim Walter, Hannah Markgraf, Jonathan Külz 他
日本語で読む → - 論文FPGA/強化学習cs.AR
QForce-RL: 量子化FPGA最適化強化学習計算エンジン
量子化と軽量アーキテクチャを活用し、FPGA上での強化学習のスループット向上とエネルギー削減を実現する計算エンジンを提案。
原題: QForce-RL: Quantized FPGA-Optimized Reinforcement Learning Compute Engine / Anushka Jha, Tanushree Dewangan, Mukul Lokhande 他
日本語で読む → - 論文強化学習ロボティクス
CARoL: ロボット学習のための文脈適応
システムダイナミクスの状態遷移から文脈を認識し、過去の知識との類似性を評価して新タスクに適応させる強化学習フレームワークを提案し、シミュレーションと実車で有効性を示した。
原題: CARoL: Context-aware Adaptation for Robot Learning / Zechen Hu, Tong Xu, Xuesu Xiao 他
日本語で読む → - 論文制御・強化学習ロボティクス
条件を揃えた比較:クアッドロータ軌道追従における古典制御と学習制御の公平な評価
クアッドロータの軌道追従において、強化学習と幾何学制御を公平に比較するための実験プロトコルを提案し、従来の比較にあった非対称なバイアスを解消した結果、両者の性能差は従来報告より小さいことを示した。
原題: Leveling the Playing Field: Carefully Comparing Classical and Learned Controllers for Quadrotor Trajectory Tracking / Pratik Kunapuli, Jake Welde, Dinesh Jayaraman 他
日本語で読む → - 論文強化学習/ロボット魚ロボティクス
深層強化学習によるバイオミメティックロボット魚の推進効率向上
深層強化学習を用いてバイオミメティックロボット魚の運動を最適化し、推進効率を高めつつエネルギー消費を抑える制御則を獲得した研究。
原題: Enhancing Efficiency and Propulsion in Bio-mimetic Robotic Fish through End-to-End Deep Reinforcement Learning / Xinyu Cui, Boai Sun, Yi Zhu 他
日本語で読む → - 論文自動運転/強化学習機械学習
乳児の睡眠を最適化する自動運転:ウェアラブルセンシングと車両センシングを融合したインテリジェントクルーズコントロール
ウェアラブルセンサと車両データを統合し、強化学習で運転の攻撃性を動的に調整することで、乳児の睡眠品質を向上させる自動運転クルーズコントロールを提案した。
原題: Towards Infant Sleep-Optimized Driving: Synergizing Wearable and Vehicle Sensing in Intelligent Cruise Control / Ruitao Chen, Mozhang Guo, Jinge Li
日本語で読む → - 論文自動運転/階層型強化学習ロボティクス
交差点におけるサンプル効率と安全性を両立する目標条件付き階層型強化学習
交差点での自動運転において、目標条件付き衝突予測モジュールを組み込んだ階層型強化学習を提案し、サンプル効率と安全性を向上させた。
原題: Goal-conditioned Hierarchical Reinforcement Learning for Sample-efficient and Safe Autonomous Driving at Intersections / Yiou Huang
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
LAMARL: LLM支援による協調方策生成のためのマルチエージェント強化学習
LLMを使って事前方策と報酬関数を自動生成し、マルチエージェント強化学習のサンプル効率とタスク達成率を大幅に改善する手法を提案。形状組み立てタスクで実機検証も行った。
原題: LAMARL: LLM-Aided Multi-Agent Reinforcement Learning for Cooperative Policy Generation / Guobin Zhu, Rui Zhou, Wenkang Ji 他
日本語で読む → - 論文強化学習ロボティクス
CHARM: 人間の特性を考慮した強化学習モデリング
人間のフィードバックパターンが、タスク統計だけでなく、ロボット経験や教育背景などの人間の特性と相関することを46人の参加者による実験で示し、人間の特性を用いることでフィードバック価値をより正確に予測できることを実証した。
原題: CHARM: Considering Human Attributes for Reinforcement Modeling / Qidi Fang, Hang Yu, Shijie Fang 他
日本語で読む → - 論文選好ベース強化学習ロボティクス
SENIOR: 選好ベース強化学習における効率的なクエリ選択と選好誘導探索
人間の選好から報酬を学習する強化学習において、比較しやすい動作区間を選ぶクエリ選択法と選好に基づく探索手法を組み合わせ、フィードバック効率と方策学習を改善した。
原題: SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning / Hexian Ni, Tao Lu, Haoyuan Hu 他
日本語で読む → - 論文ロバスト強化学習機械学習
敵対的観測に対するロバスト強化学習のためのオフポリシーアクター・クリティック:対称的政策評価による仮想代替訓練
敵対的観測に強い強化学習を目指し、エージェントと敵対者の政策評価の対称性を利用して追加の環境相互作用なしに学習するオフポリシー手法を提案した。
原題: Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation / Kosuke Nakanishi, Akihiro Kubo, Yuji Yasui 他
日本語で読む → - 論文マルチエージェント強化学習AI
適応的カリキュラムと反事実グループアドバンテージによるMARLの環境メタ定常性の克服
対戦相手の強さを勝率に応じて自動調整するカリキュラム学習と、各エージェントの貢献を分離する反事実ベースのアドバンテージ推定を組み合わせ、StarCraft協調タスクで既存手法を上回る性能を達成した研究。
原題: Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage / Weiqiang Jin, Yang Liu, Shixiang Tang 他
日本語で読む → - 論文強化学習機械学習
Mambaによる連続制御のためのアルゴリズム蒸留のスケーリング
Transformerの代わりにMamba(S6モデル)を用いてアルゴリズム蒸留を連続制御タスクに拡張し、長い文脈での学習性能を向上させた。
原題: Scaling Algorithm Distillation for Continuous Control with Mamba / Samuel Beaussant, Mehdi Mounsif
日本語で読む → - 論文オフライン強化学習機械学習
RCSLの性能を理論的に改善する方法
リターン条件付き教師あり学習(RCSL)の性能限界を克服するため、データ内最適リターンを用いるReinforced RCSLを提案し、理論的・実験的に改善を示した。
原題: How to Provably Improve Return Conditioned Supervised Learning? / Zhishuai Liu, Yu Yang, Ruhan Wang 他
日本語で読む →