論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/強化学習ロボティクス
DRARL: 介入理由を活用した強化学習による自動運転ポリシーの効率的改善
自動運転の介入事例をOOD状態推定で理由ごとに分類し、ポリシー起因の介入のみを理由拡張型の想像環境で学習に活用することで、類似状況への対応力を効率的に高める手法を提案した。
原題: DRARL: Disengagement-Reason-Augmented Reinforcement Learning for Efficient Improvement of Autonomous Driving Policy / Weitao Zhou, Bo Zhang, Zhong Cao 他
日本語で読む → - 論文オフライン強化学習機械学習
MOBODY: モデルベースの動特性ずれオフライン強化学習
動特性が異なるオフライン源データと限られた目標データから、学習した目標動特性モデルで方策を最適化し、高報酬状態を探索する手法を提案。
原題: MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning / Yihong Guo, Yu Yang, Pan Xu 他
日本語で読む → - 論文モデルベース強化学習機械学習
非線形軌道最適化によるモデルベース強化学習の加速
モデルベース強化学習MC-PILCOにiLQRを組み合わせ、探索軌道生成と方策初期化を行うことで、収束を加速し実行時間を最大45.9%削減した。
原題: Accelerating Model-Based Reinforcement Learning using Non-Linear Trajectory Optimization / Marco Calì, Giulio Giacomuzzo, Ruggero Carli 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
信頼度誘導による人間-AI協調:自動運転のための分布型代理価値伝播を用いた強化学習
自動運転において、人間の介入を最小限に抑えつつ、分布型強化学習と信頼度に基づく共有制御で人間ガイド方策と自己学習方策を動的に切り替える協調手法を提案した。
原題: Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving / Li Zeqiao, Wang Yijing, Wang Haoyu 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
Trust-MARL:異種交通流における協調合流制御のための信頼ベースマルチエージェント強化学習フレームワーク
高速道路の合流地点で、自動運転車が人間の運転車と協調するために、エージェント間の信頼を活用したマルチエージェント強化学習フレームワークを提案し、安全性・効率・快適性を向上させた。
原題: Trust-MARL: Trust-Based Multi-Agent Reinforcement Learning Framework for Cooperative On-Ramp Merging Control in Heterogeneous Traffic Flow / Jie Pan, Tianyi Wang, Christian Claudel 他
日本語で読む → - 論文マルチタスク強化学習機械学習
大きく、正則化し、カテゴリカルに:高容量価値関数は効率的なマルチタスク学習者
高容量な価値モデルをクロスエントロピーで学習し、学習可能なタスク埋め込みで条件付けることで、オンライン強化学習におけるタスク干渉を解決し、マルチタスク学習をスケーラブルにする手法を提案。
原題: Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners / Michal Nauman, Marek Cygan, Carmelo Sferrazza 他
日本語で読む → - 論文強化学習機械学習
深層アクター・クリティックのための厳密なリスク証明
深層アクター・クリティックの汎化性能を検証データから予測する厳密なリスク証明を、PAC-Bayes理論の再帰的適用により実現した。
原題: Deep Actor-Critics with Tight Risk Certificates / Bahareh Tasdighi, Manuel Haussmann, Yi-Shan Wu 他
日本語で読む → - 論文強化学習機械学習
影響力のスナップショット:オンライン強化学習のための局所データ帰属フレームワーク
オンライン強化学習(PPO)において、直近の訓練バッファ内の各経験がエージェントの行動や累積報酬に与える影響を勾配類似度で測定する局所帰属フレームワークを提案し、学習診断・行動形成の時間分析・訓練中の介入に応用。さらに経験フィルタリングを反復するIIFアルゴリズムを提案し、サンプル効率と性能を向上させた。
原題: A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning / Yuzheng Hu, Fan Wu, Haotian Ye 他
日本語で読む → - 論文強化学習ベンチマーク機械学習
ImagineBench:大規模言語モデルのロールアウトを用いた強化学習の評価ベンチマーク
LLMが生成した仮想経験(imaginary rollouts)と実環境のロールアウトを併用するオフライン強化学習アルゴリズムを評価する初のベンチマークを提案し、既存手法の課題と今後の研究方向を示した。
原題: ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts / Jing-Cheng Pang, Kaiyuan Li, Yidi Wang 他
日本語で読む → - 論文目標条件付き強化学習機械学習
目標条件付き強化学習のためのヌル反事実的因子相互作用
物体中心タスクで後知恵リラベリングが失敗する問題に対し、原因物体が存在しなければ対象物体の遷移が変わったはずという「ヌル反事実」で相互作用を定義し、それを後知恵リラベリングと組み合わせて学習効率を改善する手法を提案した。
原題: Null Counterfactual Factor Interactions for Goal-Conditioned Reinforcement Learning / Caleb Chuck, Fan Feng, Carl Qi 他
日本語で読む → - 論文自動運転/強化学習AI
信号交差点における自動運転車両のための深層強化学習に基づく縦制御戦略
信号交差点での自動運転車の縦制御に深層強化学習(DDPGとSAC)を適用し、安全性・快適性に加え効率性や黄信号時の意思決定を考慮した報酬関数を設計。実世界とシミュレーションの軌跡で訓練し、人間運転より車間距離とジャークを低減しつつ安全性を維持できることを示した。
原題: Deep reinforcement learning-based longitudinal control strategy for automated vehicles at signalised intersections / Pankaj Kumar, Aditya Mishra, Pranamesh Chakraborty 他
日本語で読む → - 論文強化学習AI
強化学習による自律移動ロボットの充電戦略:報酬と行動空間設計の影響
大規模倉庫における自律移動ロボットの充電戦略を強化学習で最適化し、報酬と行動空間の設計が性能に与える影響を評価した研究。
原題: Reinforcement Learning for AMR Charging Decisions: The Impact of Reward and Action Space Design / Janik Bischoff, Alexandru Rinciog, Anne Meyer
日本語で読む → - 論文強化学習機械学習
ロバスト制約付きMDPにおける反復計算量保証付き効率的方策最適化
実モデルとシミュレータのずれがある状況で、最悪ケースのモデルに対しても制約を満たしつつ報酬を最大化する方策を、二分探索なしでO(ε^-2)反復で学習する手法を提案した論文。
原題: Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees / Sourav Ganguly, Kishan Panaganti, Arnob Ghosh 他
日本語で読む → - 論文自動運転/安全強化学習ロボティクス
VLM-SAFE: 視覚言語モデルと世界モデルによる安全志向の自動運転強化学習
視覚言語モデルでシーンの意味的な安全信号を得て、世界モデルで将来軌道を想像し、その安全性を評価して方策を学習するオフライン安全強化学習フレームワークを提案。
原題: VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving / Yansong Qu, Zilin Huang, Zihao Sheng 他
日本語で読む → - 論文マルチエージェント強化学習AI
階層型マルチエージェント強化学習による空中戦術の強化
空中戦のシミュレーションにおいて、低レベルの個体制御と高レベルの指揮官によるマクロ命令を階層的に学習させる強化学習フレームワークを提案し、その有効性を検証した。
原題: Enhancing Aerial Combat Tactics through Hierarchical Multi-Agent Reinforcement Learning / Ardian Selmonaj, Oleg Szehr, Giacomo Del Rio 他
日本語で読む → - 論文強化学習/ロボットマニピュレーションロボティクス
TeViR: 拡散モデルによるテキストから動画への報酬生成で効率的な強化学習
テキストから動画を生成する拡散モデルを使い、予測映像と現在の観測を比較して密な報酬を生成する強化学習手法を提案。11の複雑なロボット操作タスクでサンプル効率と性能を向上させた。
原題: TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning / Yuhui Chen, Haoran Li, Zhennan Jiang 他
日本語で読む → - 論文強化学習機械学習
Multi-CALF: 統計的保証付き政策結合アプローチ
強化学習政策を相対的価値改善に基づいて組み合わせるMulti-CALFを提案し、安定性保証を継承しつつ性能向上を実現、収束確率や偏差・収束時間の理論的保証を与えた。
原題: Multi-CALF: A Policy Combination Approach with Statistical Guarantees / Georgiy Malaniya, Anton Bolychev, Grigory Yaremenko 他
日本語で読む → - 論文オフライン強化学習機械学習
FlowQ: エネルギー誘導フローポリシーによるオフライン強化学習
エネルギー誘導フローマッチングを訓練時に取り入れ、推論時の誘導を不要にしたオフライン強化学習アルゴリズムFlowQを提案。
原題: FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning / Marvin Alles, Nutan Chen, Patrick van der Smagt 他
日本語で読む → - 論文強化学習ロボティクス
ロボティクスにおけるバッチオンライン強化学習で重要な要素は何か?
自律収集データからのバッチオンライン強化学習において、アルゴリズムクラス・方策抽出法・方策表現力の3軸を体系的に検証し、Q関数の利用と暗黙的な方策抽出が性能向上に重要であることを示した。
原題: What Matters for Batch Online Reinforcement Learning in Robotics? / Perry Dong, Suvir Mirchandani, Dorsa Sadigh 他
日本語で読む → - 論文強化学習機械学習
対話型二重Deep Qネットワーク:自律走行の強化学習における人間の介入と評価的予測の統合
人間の介入を強化学習のQ値更新に直接組み込み、自律走行の性能を高めるiDDQNを提案し、介入効果を評価するオフライン枠組みも示した。
原題: Interactive Double Deep Q-network: Integrating Human Interventions and Evaluative Predictions in Reinforcement Learning of Autonomous Driving / Alkis Sygkounas, Ioannis Athanasiadis, Andreas Persson 他
日本語で読む → - 論文モデルベース強化学習機械学習
モデルベース強化学習における性能非対称性
モデルベース強化学習が人間を超えるタスクと大きく劣るタスクがある性能非対称性を指摘し、バランスの取れた評価指標Sym-HNSと新たな世界モデルJEDIを提案した。
原題: Performance Asymmetry in Model-Based Reinforcement Learning / Jing Yu Lim, Rushi Shah, Zarif Ikram 他
日本語で読む → - 論文強化学習AI
目標条件付き・メタ強化学習による汎用的動的目標認識
動的に変化する環境でエージェントの目標をリアルタイムに認識するため、目標条件付き強化学習とメタ強化学習を用いた2手法を提案し、多様な環境で高速適応と高精度を実証した。
原題: General Dynamic Goal Recognition using Goal-Conditioned and Meta Reinforcement Learning / Osher Elhadad, Owen Morrissey, Reuth Mirsky
日本語で読む → - 論文強化学習ロボティクス
強化学習による因果的好奇心を用いたパラメータ推定:限界と課題
強化学習手法「因果的好奇心」の測定精度を初めて分析し、その限界と改善提案を示した。
原題: Parameter Estimation using Reinforcement Learning Causal Curiosity: Limits and Challenges / Miguel Arana-Catania, Weisi Guo
日本語で読む → - 論文選好ベース強化学習ロボティクス
TREND: デモンストレーションを用いたノイズに頑健な選好ベース強化学習のための三者相互学習
少数の専門家デモンストレーションと三者相互学習戦略を組み合わせ、ノイズの多い選好フィードバック下でもロボットマニピュレーションタスクで高い成功率を達成する選好ベース強化学習フレームワークを提案。
原題: TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations / Shuaiyi Huang, Mara Levy, Anubhav Gupta 他
日本語で読む → - 論文安全強化学習機械学習
生涯安全を保証するエンドツーエンド安全強化学習手法
オフライン安全RLと安全な方策展開を統合し、学習から運用まで生涯にわたり安全性を保証する手法を提案。
原題: A Provable Approach for End-to-End Safe Reinforcement Learning / Akifumi Wachi, Kohei Miyaguchi, Takumi Tanabe 他
日本語で読む → - 論文強化学習/キャラクタ制御ロボティクス
AMOR: 多目的強化学習による適応的キャラクタ制御
重み付けされた複数の報酬を条件とする単一の強化学習ポリシーを訓練し、訓練後に重みを調整可能にすることで、ロボットキャラクタの動的動作生成と新規タスクへの適応を効率化した。
原題: AMOR: Adaptive Character Control through Multi-Objective Reinforcement Learning / Lucas N. Alegre, Agon Serifi, Ruben Grandia 他
日本語で読む → - 論文強化学習機械学習
学習履歴のフィルタリングによる文脈内強化学習の強化
強化学習の学習履歴を改善度と安定性で重み付け・選別し、文脈内強化学習が元アルゴリズムの劣った挙動を引き継ぐ問題を抑える手法を提案した。
原題: Filtering Learning Histories Enhances In-Context Reinforcement Learning / Weiqin Chen, Xinjie Zhang, Dharmashankar Subramanian 他
日本語で読む → - 論文オフライン強化学習機械学習
動画で強化するオフライン強化学習:モデルベースアプローチ
ラベルなし動画から世界モデルを構築し、そのモデルベースの行動ガイダンスでオフライン強化学習の性能を大幅に向上させる手法を提案。
原題: Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach / Minting Pan, Yitao Zheng, Jiajian Li 他
日本語で読む → - 論文自動運転/安全強化学習ロボティクス
調和勾配を用いた分布型Soft Actor-Criticによるマルチレーン自動運転の安全かつ効率的な学習
効率的な走行と安全制約の2つの方策勾配を調和させて衝突を抑える新しい安全強化学習手法DSAC-Hを提案し、マルチレーン自動運転でほぼ違反ゼロの効率的走行を実現した。
原題: Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios / Feihong Zhang, Guojian Zhan, Bin Shuai 他
日本語で読む → - 論文モデルベース強化学習機械学習
時間拡張行動による計画とモデルベース強化学習の改善
行動の持続時間を計画の最適化変数として扱うことで、計画の高速化とモデルベース強化学習の性能向上を実現した研究。
原題: Improving planning and MBRL with temporally-extended actions / Palash Chatterjee, Roni Khardon
日本語で読む →