論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文物理推論/LLM/強化学習機械学習
物理シミュレータ上での強化学習による物理オリンピック問題解決
物理シミュレータでランダムなシーンを生成し、合成の問答データを作ってLLMを強化学習で訓練し、実世界の物理ベンチマーク(IPhOなど)へのゼロショット転移を実証した論文。
原題: Solving Physics Olympiad via Reinforcement Learning on Physics Simulators / Mihir Prabhudesai, Aryan Satpathy, Yangmin Li 他
日本語で読む → - 論文強化学習ロボティクス
長期的ロボットタスクのための一般化可能な密な報酬
LLMとVLMを用いてタスク進捗を認識する外部報酬と、ポリシーの自己確信度に基づく内部報酬を組み合わせた密な報酬フレームワークVLLRを提案し、長期的タスクにおけるRL微調整を手動報酬設計なしで改善した。
原題: Generalizable Dense Reward for Long-Horizon Robotic Tasks / Silong Yong, Stephen Sheng, Carl Qi 他
日本語で読む → - 論文強化学習/制御ロボティクス
ReinVBC: モデルベース強化学習による車両ブレーキ制御
オフラインのモデルベース強化学習を用いて、実車のブレーキ制御を学習し、生産グレードのABSに匹敵する性能を実現した。
原題: ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller / Haoxin Lin, Junjie Zhou, Daheng Xu 他
日本語で読む → - 論文イベントベース知覚/強化学習/ロボット制御ロボティクス
生物学的に着想を得たイベントベース知覚と高効率学習による高速卓球ロボット
高速卓球ロボット向けに、イベントカメラを用いたボール検出と、低速から高速へ段階的に学習するサンプル効率的な方策訓練を組み合わせた手法を提案した。
原題: Biologically Inspired Event-Based Perception and Sample-Efficient Learning for High-Speed Table Tennis Robots / Ziqi Wang, Jingyue Zhao, Xun Xiao 他
日本語で読む → - 論文強化学習機械学習
WOMBET: ワールドモデルに基づく経験転移によるロバストでサンプル効率的な強化学習
ソースタスクでワールドモデルを学習し、不確実性ペナルティ付き計画でオフラインデータを生成・フィルタリングしてから、ターゲットタスクでオンライン微調整する経験転移フレームワークを提案した。
原題: WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning / Mintae Kim, Koushil Sreenath
日本語で読む → - 論文強化学習機械学習
Vintix II: 事前学習済み決定トランスフォーマーはスケーラブルな文脈内強化学習器である
文脈内強化学習のスケーラビリティを確立するため、多様なマルチドメイン環境にDecision Pre-Trained Transformerを拡張し、Flow Matchingを用いて訓練した。その結果、未見タスクへの汎化性能が向上し、既存手法を上回る性能を示した。
原題: Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner / Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin 他
日本語で読む → - 論文模倣学習/強化学習機械学習
不完全なデモンストレーションからの学習:時間行動木ガイドによる軌道修復
不完全なデモンストレーションを時間行動木(TBT)仕様に基づいて修復し、修復された軌道から報酬関数を抽出して強化学習を効率的に導くフレームワークを提案した。
原題: Learning from Imperfect Demonstrations via Temporal Behavior Tree-Guided Trajectory Repair / Aniruddh G. Puranic, Sebastian Schirmer, John S. Baras 他
日本語で読む → - 論文操作/強化学習ロボティクス
有界極値探索を用いた分布シフト下でのロボット操作のための深層強化学習
強化学習ポリシーを有界極値探索と組み合わせ、訓練時と異なる環境条件(分布シフト)下でのロボット操作の堅牢性を向上させるハイブリッド制御手法を提案した。
原題: Deep Reinforcement Learning for Robotic Manipulation under Distribution Shift with Bounded Extremum Seeking / Shaifalee Saxena, Rafael Fierro, Alexander Scheinker
日本語で読む → - 論文強化学習/報酬整形ロボティクス
ファジィ論理に基づく適応的報酬整形によるロバスト強化学習
ファジィ論理を用いて人間の知識を報酬設計に組み込み、状態に応じて報酬を適応的に調整する手法を提案。ドローン競技タスクで収束の高速化と性能ばらつきの低減を実証した。
原題: Fuzzy Logic Theory-based Adaptive Reward Shaping for Robust Reinforcement Learning (FARS) / Hürkan Şahin, Van Huyen Dang, Erdi Sayar 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
レーシングパラメータ化深層強化学習による自動運転車の衝突回避
自動運転車の衝突回避に、レースカーの追い越しを模したパラメータ化深層強化学習を適用し、シミュレーションで学習したポリシーを実機に転移して、従来のMPC-APFより優れた性能と低計算コストを実証した。
原題: Autonomous Vehicle Collision Avoidance With Racing Parameterized Deep Reinforcement Learning / Shathushan Sivashangaran, Vihaan Dutta, Apoorva Khairnar 他
日本語で読む → - 論文強化学習機械学習
占有報酬整形:オフライン目標条件付き強化学習におけるクレジット割り当ての改善
生成世界モデルから最適輸送を用いて幾何学的情報を抽出し、報酬関数を整形することで、スパース報酬環境でのクレジット割り当て問題を緩和する手法を提案。13の長距離タスクで2.2倍の性能向上を実証し、核融合制御にも応用。
原題: Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning / Aravind Venugopal, Jiayu Chen, Xudong Wu 他
日本語で読む → - 論文強化学習/フローマッチングロボティクス
ScoRe-Flow: スコアベース強化学習によるフローマッチングの完全な分布制御
フローマッチングポリシーを強化学習で微調整する際、スコア関数によるドリフト変調と学習可能な分散予測を組み合わせ、遷移の平均と分散を分離制御する手法を提案。D4RLや操作タスクで高速収束と成功率向上を実証。
原題: ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching / Xiaotian Qiu, Lukai Chen, Jinhao Li 他
日本語で読む → - 論文強化学習機械学習
強化学習ロボットエージェントのための視覚言語行動ジャンプスタート
本論文では、視覚言語行動モデルを強化学習の初期探索に活用し、学習効率を向上させる手法を提案する。
原題: Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents / Angelo Moroncelli, Roberto Zanetti, Marco Maccarini 他
日本語で読む → - 論文安全制御/強化学習制御
敵対的強化学習による最大ロバスト制御バリア関数の合成と展開
一般の非線形システムに対して、動的計画法とQ関数を用いた新しいロバスト制御バリア関数を提案し、敵対的強化学習で合成・展開する手法を導入した。
原題: Synthesis and Deployment of Maximal Robust Control Barrier Functions through Adversarial Reinforcement Learning / Donggeon David Oh, Duy P. Nguyen, Haimin Hu 他
日本語で読む → - 論文安全強化学習ロボティクス
ブラックボックスハイブリッド力学系におけるハードアフィン制約を証明付きで満たす制御ポリシーの学習
未知の非線形ダイナミクスを持つハイブリッドシステムに対し、制約境界付近でアフィンかつ反発的なポリシーを強制することで、閉ループで安全制約を証明付きで満たす強化学習ポリシーを学習する手法を提案した。
原題: Learning Control Policies to Provably Satisfy Hard Affine Constraints for Black-Box Hybrid Dynamical Systems / Aayushi Shrivastava, Kartik Nagpal, Sairam Jinkala 他
日本語で読む → - 論文強化学習/拡散ポリシー機械学習
FlowRL: 拡散ポリシーを用いた強化学習の分類法とモジュール型フレームワーク
拡散モデルやフローモデルをポリシーとして用いる強化学習アルゴリズムを体系的に分類し、JAXベースのモジュール型コードベースと標準ベンチマークを提供した論文。
原題: FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies / Chenxiao Gao, Edward Chen, Tianyi Chen 他
日本語で読む → - 論文強化学習機械学習
予測ベースのマルコフ違反スコアによる強化学習における非マルコフ観測の検出
強化学習の観測がマルコフ性を満たさない場合を検出するため、予測誤差に基づくマルコフ違反スコア(MVS)を提案し、複数の環境とアルゴリズムでその有効性を検証した。
原題: Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning / Naveen Mysore
日本語で読む → - 論文オフライン強化学習機械学習
微分可能な世界モデルを用いたオフライン強化学習の推論時ポリシー最適化
事前学習済みポリシーと学習済み世界モデルを用いて、推論時にポリシーパラメータを勾配法で最適化するフレームワークを提案し、D4RLベンチマークで性能向上を確認した。
原題: Inference Time Policy Optimization for Offline RL with Differentiable World Models / Rohan Deb, Stephen J. Wright, Arindam Banerjee
日本語で読む → - 論文VLA/強化学習機械学習
AcceRL: 視覚言語行動モデルのための分散非同期強化学習と世界モデルフレームワーク
同期バリアと環境データ取得コストによるボトルネックを解消するため、環境ロールアウト・モデル推論・勾配更新を物理的に分離した分散非同期RLフレームワークを提案し、スループットとサンプル効率を大幅に向上させた。
原題: AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models / Chengxuan Lu, Shukuan Wang, Yanjie Li 他
日本語で読む → - 論文強化学習機械学習
統一ポリシー価値分解による迅速な適応
ポリシーと価値関数が低次元の目標埋め込みを共有する枠組みを導入し、事前学習で二線形分解を行い、テスト時には勾配更新なしで即座に新しいタスクへ適応する手法を提案した。
原題: Unified Policy Value Decomposition for Rapid Adaptation / Cristiano Capone, Luca Falorsi, Andrea Ciardiello 他
日本語で読む → - 論文強化学習/ヒューマノイド制御機械学習
FastDSAC: 高次元ヒューマノイド制御における最大エントロピー強化学習の可能性を引き出す
高次元のヒューマノイド制御で、次元ごとのエントロピー調整と連続分布型クリティックを導入し、最大エントロピー強化学習の性能を大幅に向上させた。
原題: FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control / Jun Xue, Junze Wang, Shanze Wang 他
日本語で読む → - 論文強化学習機械学習
ベルマン整合性とハイブリッド批評家によるクロスドメイン方策最適化
強化学習において、ソースドメインのデータを活用してターゲットドメインの学習を効率化するクロスドメイン転移を扱い、ドメイン間の状態・行動空間の違いと転移の負の影響を同時に解決する手法QAvatarを提案した。
原題: Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics / Ming-Hong Chen, Kuan-Chen Pan, You-De Huang 他
日本語で読む → - 論文連続強化学習機械学習
ARROW: 拡張リプレイによる堅牢な世界モデル
連続強化学習における破滅的忘却を防ぐため、モデルベースRLアルゴリズムDreamerV3に、短期・長期の2つのバッファを持つメモリ効率の良いリプレイ手法を導入し、タスク多様性を保ちながら学習を安定化させる手法を提案した。
原題: ARROW: Augmented Replay for RObust World models / Abdulaziz Alyahya, Abdallah Al Siyabi, Markus R. Ernst 他
日本語で読む → - 論文モデルベース強化学習機械学習
Dreamer-CDP: 連続決定論的表現予測による再構築不要ワールドモデルの改善
Dreamerなどのモデルベース強化学習エージェントで、観測再構築を使わずにJEPAスタイルの連続決定論的表現予測を導入し、Crafter環境で再構築ベース手法と同等の性能を達成した。
原題: Dreamer-CDP: Improving Reconstruction-free World Models Via Continuous Deterministic Representation Prediction / Michael Hauri, Friedemann Zenke
日本語で読む → - 論文オフライン強化学習機械学習
IPD: オフライン強化学習における想像的計画蒸留による逐次方策の強化
オフライン強化学習の逐次方策モデルに対し、世界モデルと準最適価値関数を用いて劣った軌道を特定し、想像上の最適ロールアウトを生成してデータ拡張と蒸留を行う新しい枠組みIPDを提案した。
原題: IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning / Yihao Qin, Yuanfei Wang, Hang Zhou 他
日本語で読む → - 論文メタ強化学習機械学習
オフラインメタ強化学習のための文脈潜在世界モデル
オフラインのメタ強化学習において、タスク表現を潜在世界モデルに条件付けして共同学習することで、タスク依存のダイナミクスを捉える表現を獲得し、未見タスクへの汎化性能を向上させた。
原題: Contextual Latent World Models for Offline Meta Reinforcement Learning / Mohammadreza Nakheai, Aidan Scannell, Kevin Luck 他
日本語で読む → - 論文強化学習/共有制御/リハビリテーションロボティクス
分離タスク空間におけるイベント駆動型人-ロボット共適応のためのデュアルエージェント・マルチモデル強化学習
上肢リハビリロボットの共有制御において、人間のバイナリ指令とロボットの自律補正をイベント駆動で切り替え、デュアルエージェント強化学習により人間の速度-精度トレードオフとロボットの動作ステップを適応させる手法を提案した。
原題: Dual-Agent Multiple-Model Reinforcement Learning for Event-Triggered Human-Robot Co-Adaptation in Decoupled Task Spaces / Yaqi Li, Zhengqi Han, Huifang Liu 他
日本語で読む → - 論文強化学習機械学習
強化学習の解釈のための損失ランドスケープ可視化フレームワーク:ADHDPケーススタディ
強化学習の学習過程を可視化するフレームワークを提案し、ADHDPアルゴリズムを宇宙機の姿勢制御に適用して、損失曲面や状態TDマップなど4つの視点から学習ダイナミクスを解釈する。
原題: A Loss Landscape Visualization Framework for Interpreting Reinforcement Learning: An ADHDP Case Study / Jingyi Liu, Jian Guo, Eberhard Gill
日本語で読む → - 論文強化学習/海上ルーティングAI
物理情報を活用したオフライン強化学習が海上ルーティングにおける壊滅的な燃料浪費を排除
船舶の航路決定に物理情報を組み込んだオフライン強化学習フレームワークPIERを提案し、メキシコ湾の実データで平均CO2排出量を10%削減し、極端な燃料消費の発生率を9分の1に低減した。
原題: Physics-informed offline reinforcement learning eliminates catastrophic fuel waste in maritime routing / Aniruddha Bora, Julie Chalfant, Chryssostomos Chryssostomidis
日本語で読む → - 論文強化学習/操作ロボティクス
D-SPEAR: ロボット操作における安定強化学習のための二重ストリーム優先経験適応リプレイ
アクターとクリティカルのサンプリングを分離し、適応アンカー機構で優先度付きリプレイと一様リプレイを切り替えることで、ロボット操作タスクでの強化学習の安定性と性能を向上させる手法を提案した。
原題: D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation / Yu Zhang, Karl Mason
日本語で読む →