論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文マルチエージェント強化学習機械学習
オフライン型マルチエージェント強化学習の安定化レシピ
オフラインMARLにおける非線形価値分解の不安定性を分析し、スケール不変な価値正規化(SVN)を提案して安定な学習を実現する手法を提案した論文。
原題: A Recipe for Stable Offline Multi-agent Reinforcement Learning / Dongsu Lee, Daehee Lee, Amy Zhang
日本語で読む → - 論文逆強化学習ロボティクス
逆強化学習による人間動作のグローバル意図推定に向けて
単一の統一コスト関数で人間の到達動作を説明・予測できるかを、逆強化学習を用いて検証し、時間変化するコスト重みが軌道再構成を大幅に改善することを示した論文。
原題: Toward Global Intent Inference for Human Motion by Inverse Reinforcement Learning / Sarmad Mehrdad, Maxime Sabbah, Vincent Bonnet 他
日本語で読む → - 論文強化学習/飛行ロボットロボティクス
MAVEN: 動的変化に強いアジャイルクアッドローター操縦のためのメタ強化学習フレームワーク
クアッドローターの動的特性が大きく変わる状況でも単一のポリシーで頑健にナビゲーションできるよう、予測的コンテキストエンコーダを備えたメタ強化学習フレームワークMAVENを提案し、質量変化や単一ローター推力喪失下での適応性と実機へのゼロショット転送を実証した。
原題: MAVEN: A Meta-Reinforcement Learning Framework for Varying-Dynamics Expertise in Agile Quadrotor Maneuvers / Jin Zhou, Dongcheng Cao, Xian Wang 他
日本語で読む → - 論文強化学習機械学習
オフポリシー強化学習への批判的マッチ損失ランドスケープ可視化の適応
オンライン強化学習向けの批判的マッチ損失ランドスケープ可視化手法を、リプレイベースのオフポリシー強化学習(SACなど)に適応させ、批判的学習の最適化幾何学を可視化する手法を提案した。宇宙機の姿勢制御問題に適用し、収束・発散のケースで異なる幾何学的パターンを示すことを確認した。
原題: Adapting Critic Match Loss Landscape Visualization to Off-policy Reinforcement Learning / Jingyi Liu, Jian Guo, Eberhard Gill
日本語で読む → - 論文手術ロボティクス/オフライン強化学習ロボティクス
SutureFormer: ピクセル空間における目標条件付きオフライン強化学習による手術軌道の学習
内視鏡映像から針先の軌道を逐次意思決定問題として捉え、スプライン補間で疎な注釈を密な報酬に変換する目標条件付きオフライン強化学習フレームワークを提案した。
原題: SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space / Huanrong Liu, Chunlin Tian, Tongyu Jia 他
日本語で読む → - 論文強化学習機械学習
タスクと行動の分離:ロボティクス強化学習における二段階報酬カリキュラム
報酬設計の難しさを解決するため、タスク報酬と行動報酬を分離し、まずタスクのみで学習してから行動報酬を導入する二段階カリキュラムを提案した。
原題: Decoupling Task and Behavior: A Two-Stage Reward Curriculum in Reinforcement Learning for Robotics / Kilian Freitag, Knut Åkesson, Morteza Haghir Chehreghani
日本語で読む → - 論文階層的強化学習ロボティクス
HierKick: 視覚誘導サッカーロボット制御のための階層的強化学習
サッカーロボット制御のための二周波数階層型強化学習フレームワークを提案し、高レベル方策で戦術選択、低レベル制御で精密な関節動作を実現。シミュレーションと実機で高い成功率を達成した。
原題: HierKick: Hierarchical Reinforcement Learning for Vision-Guided Soccer Robot Control / Yizhi Chen, Zheng Zhang, Zhanxiang Cao 他
日本語で読む → - 論文強化学習/交通制御機械学習
RE-SAC: バス群制御における偶然不確実性と認識不確実性の分離 — 安定でロバストなアンサンブル深層強化学習アプローチ
バス運行の待機制御において、偶然不確実性と認識不確実性を明示的に分離するアンサンブルSACを提案し、Q値の不安定化を抑えて希少状態での推定誤差を最大62%削減した。
原題: RE-SAC: Disentangling aleatoric and epistemic risks in bus fleet control: A stable and robust ensemble DRL approach / Yifan Zhang, Liang Zheng
日本語で読む → - 論文強化学習機械学習
PPOのためのActor-Critic事前学習
強化学習PPOにおいて、Actorを模倣学習で、Criticを事前学習済み方策のロールアウトから得たリターンで初期化する手法を提案し、15のロボット操作・歩行タスクでサンプル効率を大幅に改善した。
原題: Actor-Critic Pretraining for Proximal Policy Optimization / Andreas Kernbach, Amr Elsheikh, Nicolas Grupp 他
日本語で読む → - 論文選好ベース強化学習機械学習
OPRIDE: データセット内探索によるオフライン選好ベース強化学習
オフライン選好ベース強化学習において、クエリ効率を高めるための探索戦略と割引スケジューリングを組み合わせた手法を提案し、少ないクエリで高性能を達成した。
原題: OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration / Yiqin Yang, Hao Hu, Yihuan Mao 他
日本語で読む → - 論文モデルベース強化学習機械学習
WIMLE: 不確実性を考慮した世界モデルによるサンプル効率の高い連続制御
IMLEを用いてマルチモーダルな世界モデルを学習し、予測不確実性で重み付けすることで、連続制御タスクのサンプル効率と性能を向上させたモデルベース強化学習手法。
原題: WIMLE: Uncertainty-Aware World Models with IMLE for Sample-Efficient Continuous Control / Mehran Aghabozorgi, Alireza Moazeni, Yanshu Zhang 他
日本語で読む → - 論文強化学習機械学習
潜在ダイナミクスによるモデルフリーの効率性とモデルベース表現の統合
モデルフリーの効率性とモデルベースの表現力を統合した強化学習アルゴリズムULDを提案し、多様な環境で高性能かつ少ないパラメータで動作することを示した。
原題: Unifying Model-Free Efficiency and Model-Based Representations via Latent Dynamics / Jashaswimalya Acharjee, Balaraman Ravindran
日本語で読む → - 論文マルチエージェント強化学習機械学習
共同状態行動埋め込みを用いたマルチエージェントモデルベース強化学習
部分観測環境で多数のエージェントを協調させるため、世界モデルと想像ロールアウトに共同状態行動埋め込み(SALE)を統合したモデルベースMARLフレームワークを提案し、StarCraft IIやMulti-Agent MuJoCoなどで性能向上を示した。
原題: Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings / Zhizun Wang, David Meger
日本語で読む → - 論文モデルベース強化学習機械学習
楽観的ワールドモデル:モデルベース深層強化学習における効率的探索
モデル学習に楽観的なダイナミクス損失を組み込み、報酬の高い遷移を優先する探索手法を提案。DreamerV3やSTORMに適用し、サンプル効率と累積報酬を改善。
原題: Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning / Akshay Mete, Shahid Aamir Sheikh, Tzu-Hsiang Lin 他
日本語で読む → - 論文エージェント強化学習AI
エージェント世界モデル:エージェント強化学習のための無限合成環境
LLMエージェントの強化学習用に、コード駆動でデータベースに裏打ちされた1000の合成環境を自動生成するパイプラインを提案し、ベンチマーク外への汎化性能を実証した。
原題: Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning / Zhaoyang Wang, Canwen Xu, Boyi Liu 他
日本語で読む → - 論文制約付き強化学習機械学習
制約付き強化学習のための確率的決定ホライズン
制約違反がホライズンを短縮する確率的決定ホライズン(SDH)を提案し、制約付きRLのオフポリシーかつ正則化アルゴリズムを開発した。
原題: Stochastic Decision Horizons for Constrained Reinforcement Learning / Nikola Milosevic, Leonard Franz, Daniel Haeufle 他
日本語で読む → - 論文モデルベース強化学習機械学習
再パラメータ化フローポリシー最適化
フローポリシーをモデルベース強化学習に組み込み、生成過程とダイナミクスをまとめて誤差逆伝播することで、高いサンプル効率と安定性を実現した手法を提案。
原題: Reparameterization Flow Policy Optimization / Hai Zhong, Zhuoran Li, Xun Wang 他
日本語で読む → - 論文ゼロショット強化学習機械学習
ゼロショットオフポリシー学習
後継測度と定常密度比の理論的関連を利用し、報酬なしデータで訓練したエージェントがテスト時に追加学習なしで新タスクに適応できるゼロショット強化学習手法を提案。
原題: Zero-Shot Off-Policy Learning / Arip Asadulaev, Maksim Bobrin, Salem Lahlou 他
日本語で読む → - 論文強化学習機械学習
選択モデル支援Q学習による遅延フィードバック収益管理
遅延フィードバックのある収益管理において、較正済み離散選択モデルを部分的世界モデルとして用いて学習目標の遅延成分を補完するQ学習を提案し、理論的収束保証とホテル予約データに基づく実験で有効性と限界を示した。
原題: Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management / Owen Shen, Patrick Jaillet
日本語で読む → - 論文強化学習機械学習
階層的ニューラルオプションと抽象世界モデルの同時学習
抽象世界モデルと階層的ニューラルオプションを同時に学習するAgentOWLを提案し、少ないデータでより多くのスキルを獲得できることを示した。
原題: Joint Learning of Hierarchical Neural Options and Abstract World Model / Wasu Top Piriyakulkij, Wolfgang Lehrach, Kevin Ellis 他
日本語で読む → - 論文強化学習機械学習
未知の実行可能性を持つパラメータロバスト回避問題を強化学習で解く
強化学習を用いて、安全な方策が存在する初期条件の部分集合を特定しながら、その集合上で到達可能性問題を解く手法FGEを提案した。
原題: Solving Parameter-Robust Avoid Problems with Unknown Feasibility using Reinforcement Learning / Oswin So, Eric Yang Yu, Songyuan Zhang 他
日本語で読む → - 論文強化学習/制御ロボティクス
アクションジャコビアンペナルティで滑らかな時変線形方策を学習
アクションの時間変化を自動微分で罰則化するアクションジャコビアンペナルティと、計算負荷を抑える線形方策ネットワークを提案し、滑らかな制御信号を生成する方策を学習する。
原題: Learning Smooth Time-Varying Linear Policies with an Action Jacobian Penalty / Zhaoming Xie, Kevin Karol, Jessica Hodgins
日本語で読む → - 論文外骨格/強化学習ロボティクス
強化学習によるモジュラー股関節・膝関節外骨格のスクワット支援
物理シミュレーションで強化学習したニューラルネット制御器を股関節・膝関節外骨格に適用し、スクワット時の代謝コストを約10%削減できることを示した。
原題: Reinforcement-Learning-Based Assistance Reduces Squat Effort with a Modular Hip--Knee Exoskeleton / Neethan Ratnakumar, Mariya Huzaifa Tohfafarosh, Saanya Jauhri 他
日本語で読む → - 論文強化学習×軌道最適化ロボティクス
CACTO-BIC: バイアス付きサンプリングとGPU加速軌道最適化によるスケーラブルなアクター・クリティック学習
軌道最適化と強化学習を組み合わせたCACTOを改良し、価値関数に基づく初期状態サンプリングのバイアスとGPU加速により、サンプル効率と計算速度を向上させた。四足ロボットAlienGOでリアルタイム応用可能なスケーラビリティを示した。
原題: CACTO-BIC: Scalable Actor-Critic Learning via Biased Sampling and GPU-Accelerated Trajectory Optimization / Elisa Alboni, Pietro Noah Crestaz, Elias Fontanari 他
日本語で読む → - 論文歩行/リハビリ/強化学習ロボティクス
片側筋力低下による歩行非対称性と足関節アシストによる改善:強化学習に基づくシミュレーション研究
強化学習と筋骨格シミュレーションを用いて、片脚の筋力低下が歩行の非対称性をどの程度引き起こすかを定量化し、足関節外骨格によるアシストが非対称性を改善できるかを検証した。
原題: Gait Asymmetry from Unilateral Weakness and Improvement With Ankle Assistance: a Reinforcement Learning based Simulation Study / Yifei Yuan, Ghaith Androwis, Xianlian Zhou
日本語で読む → - 論文強化学習/ドローンレースロボティクス
ランダム障害物を伴うクアッドロータレースのためのカリキュラム強化学習
視覚ベースのカリキュラム強化学習で、障害物のあるドローンレースにおいて高速かつ堅牢に飛行する制御器を訓練した研究。
原題: Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles / Fangyu Sun, Fanxing Li, Yu Hu 他
日本語で読む → - 論文軌道ロボティクス/強化学習AI
強化学習による多数デブリランデブー計画の最適化:燃料補給と適応的衝突回避の統合
小型衛星による複数デブリ除去のため、燃料補給と適応的衝突回避を組み込んだマスク付きPPO強化学習でランデブー順序と軌道を最適化する枠組みを提案した。
原題: Optimizing Mission Planning for Multi-Debris Rendezvous Using Reinforcement Learning with Refueling and Adaptive Collision Avoidance / Agni Bandyopadhyay, Gunther Waxenegger-Wilfing
日本語で読む → - 論文マルチエージェント強化学習/自動運転ロボティクス
TSC: 相互作用運転のためのトポロジー条件付きシュタッケルベルク型マルチエージェント強化学習
軌跡の編み込み関係から動的な優先度グラフを抽出し、局所的なリーダー・フォロワー関係に基づくシュタッケルベルク型協調方策をCTDEで学習する、通信不要の分散型自動運転フレームワークを提案。
原題: TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving / Xiaotong Zhang, Gang Xiong, Yuanjing Wang 他
日本語で読む → - 論文安全強化学習機械学習
摂動下で頑健なニューラルLyapunov障壁証明書の形式的合成
システムダイナミクスの有界な摂動に対して安全性・安定性の保証を維持する頑健なニューラルLyapunov障壁証明書を、敵対的訓練とLipschitz正則化で学習する手法を提案し、倒立振子と2Dドッキングで有効性を示した。
原題: Formal Synthesis of Certifiably Robust Neural Lyapunov-Barrier Certificates / Chengxiao Wang, Haoze Wu, Gagandeep Singh
日本語で読む → - 論文自動運転/強化学習ロボティクス
ベクトル意味表現と記号推論による人間中心の自動緊急ブレーキのための強化学習強化
自動運転の緊急ブレーキにおいて、意味・空間・形状情報を統合したニューロシンボリック特徴表現と、ソフト一階論理による報酬関数を提案し、安全性と政策の堅牢性を向上させた。
原題: Reinforcement Learning Enhancement Using Vector Semantic Representation and Symbolic Reasoning for Human-Centered Autonomous Emergency Braking / Vinal Asodia, Iman Sharifi, Saber Fallah
日本語で読む →