論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習/部分観測/MPC/四足歩行機械学習
PriPG-RL: 部分観測システムのための特権プランナー誘導強化学習と常時実行可能なMPC
部分観測環境下で強化学習ポリシーを訓練する際、訓練時のみ利用可能な特権プランナー(近似モデルと完全状態情報を持つMPC)が学習エージェントを誘導する枠組みを提案し、シミュレーションと実機の四足ロボットで検証した。
原題: PriPG-RL: Privileged Planner-Guided Reinforcement Learning for Partially Observable Systems with Anytime-Feasible MPC / Mohsen Amiri, Mohsen Amiri, Ali Beikmohammadi 他
日本語で読む → - 論文強化学習/水中ロボットロボティクス
自律サンゴ礁モニタリングのための文脈型マルチタスク強化学習
水中ロボットの不確実な動的環境下での制御を、文脈型マルチタスク強化学習を用いて学習し、サンゴ礁監視タスクの汎用性と堅牢性を向上させる手法を提案・評価した。
原題: Contextual Multi-Task Reinforcement Learning for Autonomous Reef Monitoring / Melvin Laux, Yi-Ling Liu, Rina Alo 他
日本語で読む → - 論文移動操作/触覚/強化学習ロボティクス
触覚を活用した四脚ロボットの移動操作ポリシー学習
四脚ロボットの移動操作において、視覚と自己受容感覚に加えて触覚情報を活用する階層的ポリシー学習手法を提案。実世界の人間デモから触覚条件付き高レベルポリシーを学習し、シミュレーションでの大規模強化学習により全身制御ポリシーを獲得し、実世界へゼロショット転送する。接触を伴うタスクで平均28.54%の性能向上を達成。
原題: Learning Tactile-Aware Quadrupedal Loco-Manipulation Policies / Pokuang Zhou, Yuhao Zhou, Quan Khanh Luu 他
日本語で読む → - 論文強化学習/フローマッチングロボティクス
ScoRe-Flow: スコアベース強化学習によるフローマッチングの完全な分布制御
フローマッチングポリシーを強化学習で微調整する際、スコア関数によるドリフト変調と学習可能な分散予測を組み合わせ、遷移の平均と分散を分離制御する手法を提案。D4RLや操作タスクで高速収束と成功率向上を実証。
原題: ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching / Xiaotian Qiu, Lukai Chen, Jinhao Li 他
日本語で読む → - 論文強化学習/自動運転ロボティクス
実世界アジャイル運転のためのリセットフリー強化学習:実証研究
物理的な1/10スケール車両を滑りやすい屋内トラックで手動リセットなしに連続学習させるリセットフリー強化学習を実証し、シミュレーションと実世界での性能差を明らかにした。
原題: Reset-Free Reinforcement Learning for Real-World Agile Driving: An Empirical Study / Kohei Honda, Hirotaka Hosogaya
日本語で読む → - 論文組立/強化学習ロボティクス
複合ロボット組立スキル適応のための学習ベース戦略
位置制御マニピュレータによるペグ・イン・ホール組立を対象に、残差強化学習を用いて接触リッチな作業中の適応を実現する、再利用可能な複合スキル戦略を提案した。
原題: Learning-Based Strategy for Composite Robot Assembly Skill Adaptation / Khalil Abuibaid, Aleksandr Sidorenko, Achim Wagner 他
日本語で読む → - 論文強化学習/波面制御astro-ph.IM
モデルベース強化学習による焦点面波面制御
強化学習を用いて、望遠鏡の焦点面画像から非共通光路収差を自動検出・補正する新しい制御手法を提案した論文。
原題: Focal plane wavefront control with model-based reinforcement learning / Jalo Nousiainen, Iremsu Taskin, Markus Kasper 他
日本語で読む → - 論文シミュレーション/義足/強化学習ロボティクス
柔軟なスポーツ義足を用いた適応的走行の強化学習によるハイブリッドリンク系シミュレーション
片側下腿切断者の走行運動を、義足の柔軟性を考慮したハイブリッドリンク系と強化学習を用いてシミュレーションし、義足の剛性が走行性能や代謝コストに与える影響を解析した。
原題: Simulation of Adaptive Running with Flexible Sports Prosthesis using Reinforcement Learning of Hybrid-link System / Yuta Shimane, Ko Yamamoto
日本語で読む → - 論文強化学習機械学習
Vintix II: 事前学習済み決定トランスフォーマーはスケーラブルな文脈内強化学習器である
文脈内強化学習のスケーラビリティを確立するため、多様なマルチドメイン環境にDecision Pre-Trained Transformerを拡張し、Flow Matchingを用いて訓練した。その結果、未見タスクへの汎化性能が向上し、既存手法を上回る性能を示した。
原題: Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner / Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin 他
日本語で読む → - 論文強化学習/探索ロボティクス
表形式基盤モデルはロボット方策学習の探索を導けるか?
高次元連続制御における方策最適化の探索を改善するため、局所更新と表形式基盤モデルによる大域的探索を組み合わせたハイブリッド手法TFM-S3を提案し、限られたロールアウト予算で収束を加速し最終性能を向上させることを示した。
原題: Can Tabular Foundation Models Guide Exploration in Robot Policy Learning? / Buqing Ou, Frederike Dümbgen
日本語で読む → - 論文強化学習機械学習
WOMBET: ワールドモデルに基づく経験転移によるロバストでサンプル効率的な強化学習
ソースタスクでワールドモデルを学習し、不確実性ペナルティ付き計画でオフラインデータを生成・フィルタリングしてから、ターゲットタスクでオンライン微調整する経験転移フレームワークを提案した。
原題: WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning / Mintae Kim, Koushil Sreenath
日本語で読む → - 論文強化学習ロボティクス
長期的ロボットタスクのための一般化可能な密な報酬
LLMとVLMを用いてタスク進捗を認識する外部報酬と、ポリシーの自己確信度に基づく内部報酬を組み合わせた密な報酬フレームワークVLLRを提案し、長期的タスクにおけるRL微調整を手動報酬設計なしで改善した。
原題: Generalizable Dense Reward for Long-Horizon Robotic Tasks / Silong Yong, Stephen Sheng, Carl Qi 他
日本語で読む → - 論文強化学習機械学習
時間変動ダイナミクス下での制御のためのモデルベース強化学習
システムダイナミクスが時間とともに変化する環境で、古いデータの影響を制限する適応バッファ機構を持つ楽観的モデルベース強化学習アルゴリズムを提案し、非定常な連続制御ベンチマークでの性能向上を示した。
原題: Model-Based Reinforcement Learning for Control under Time-Varying Dynamics / Klemens Iten, Bruce Lee, Chenhao Li 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
PALCAS: 連合強化学習を用いた自動運転車向け優先度考慮型インテリジェント車線変更アドバイザリーシステム
自動運転車の車線変更を、目的地への緊急度に基づく優先度を考慮しつつ、連合強化学習とPDQNアルゴリズムで協調的に制御するシステムを提案し、シミュレーションで有効性を示した論文。
原題: PALCAS: A Priority-Aware Intelligent Lane Change Advisory System for Autonomous Vehicles using Federated Reinforcement Learning / Yassine Ibork, Nhat Ha Nguyen, Myounggyu Won 他
日本語で読む → - 論文物理推論/LLM/強化学習機械学習
物理シミュレータ上での強化学習による物理オリンピック問題解決
物理シミュレータでランダムなシーンを生成し、合成の問答データを作ってLLMを強化学習で訓練し、実世界の物理ベンチマーク(IPhOなど)へのゼロショット転移を実証した論文。
原題: Solving Physics Olympiad via Reinforcement Learning on Physics Simulators / Mihir Prabhudesai, Aryan Satpathy, Yangmin Li 他
日本語で読む → - 論文計画・強化学習ロボティクス
運動学から動力学へ:物理的に実行可能なハイブリッド計画の学習による洗練
ハイブリッドプランナーが生成した一次(運動学的)計画を、強化学習を用いて二次(動的)制約を満たす物理的に実行可能な軌道へと洗練する手法を提案した論文。
原題: From Kinematics to Dynamics: Learning to Refine Hybrid Plans for Physically Feasible Execution / Lidor Erez, Shahaf S. Shperberg, Ayal Taitler
日本語で読む → - 論文強化学習機械学習
FlashSAC: 高次元ロボット制御のための高速かつ安定なオフポリシー強化学習
オフポリシー強化学習の不安定性を解決するため、勾配更新を削減しつつモデル規模とデータ処理量を増やし、ノルム制約で安定化したFlashSACを提案。60以上のタスクでPPO等を上回る性能と効率を示した。
原題: FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control / Donghu Kim, Youngdo Lee, Minho Park 他
日本語で読む → - 論文強化学習ロボティクス
線形クープマンダイナミクスを用いた非線形ロボットシステムの効率的強化学習
クープマン作用素理論で非線形システムの線形リフトダイナミクスを学習し、アクタークリティック型強化学習に統合することで、サンプル効率の高い閉ループ制御を実現した。
原題: Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems / Wenjian Hao, Yuxuan Fang, Zehui Lu 他
日本語で読む → - 論文強化学習/ビンパッキングロボティクス
拡散強化学習に基づくオンライン3Dビンパッキングの空間戦略最適化
オンライン3Dビンパッキング問題に対し、拡散モデルをアクターネットワークに用いた強化学習アルゴリズムを提案し、従来のDRL手法より詰め込めるアイテム数を大幅に改善した。
原題: Diffusion Reinforcement Learning Based Online 3D Bin Packing Spatial Strategy Optimization / Jie Han, Tong Li, Qingyang Xu 他
日本語で読む → - 論文模倣学習/強化学習機械学習
不完全なデモンストレーションからの学習:時間行動木ガイドによる軌道修復
不完全なデモンストレーションを時間行動木(TBT)仕様に基づいて修復し、修復された軌道から報酬関数を抽出して強化学習を効率的に導くフレームワークを提案した。
原題: Learning from Imperfect Demonstrations via Temporal Behavior Tree-Guided Trajectory Repair / Aniruddh G. Puranic, Sebastian Schirmer, John S. Baras 他
日本語で読む → - 論文強化学習ロボティクス
行動制約付き強化学習と後退地平線クレジット割り当てによる高性能制御
専門家の行動から逸脱しすぎずに、デモンストレーションを超える高性能な制御ポリシーを学習する強化学習フレームワークを提案した。
原題: Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control / Siwei Ju, Jan Tauberschmidt, Oleg Arenz 他
日本語で読む → - 論文強化学習ロボティクス
VA-FastNavi-MARL: マルチメディア駆動メタ強化学習によるリアルタイムロボット制御
音声と視覚の非同期入力を統一表現に変換し、メタ強化学習で未知の指示に迅速適応するロボット制御フレームワークを提案。マルチアーム環境でサンプル効率とリアルタイム性を実証した。
原題: VA-FastNavi-MARL: Real-Time Robot Control with Multimedia-Driven Meta-Reinforcement Learning / Yang Zhang, Shengxi Jing, Fengxiang Wang 他
日本語で読む → - 論文強化学習/UAVロボティクス
限られたシミュレーション訓練下での捜索救助UAVミッションにおける目標条件付き強化学習のためのルールベース高レベルコーチング
固定ルールの高レベルアドバイザとオンライン学習する低レベル強化学習コントローラを組み合わせた階層型意思決定フレームワークを提案し、限られた訓練環境でも早期の安全性とサンプル効率を向上させる。
原題: Rule-based High-Level Coaching for Goal-Conditioned Reinforcement Learning in Search-and-Rescue UAV Missions Under Limited-Simulation Training / Mahya Ramezani, Holger Voos
日本語で読む → - 論文強化学習/制御ロボティクス
ReinVBC: モデルベース強化学習による車両ブレーキ制御
オフラインのモデルベース強化学習を用いて、実車のブレーキ制御を学習し、生産グレードのABSに匹敵する性能を実現した。
原題: ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller / Haoxin Lin, Junjie Zhou, Daheng Xu 他
日本語で読む → - 論文強化学習ロボティクス
ViVa: ロボット強化学習のためのビデオ生成価値モデル
事前学習済みのビデオ生成モデルを価値関数として再利用し、将来の身体状態とスカラー価値を同時に予測することで、ロボット操作タスクにおける価値推定を改善する手法を提案した。
原題: ViVa: A Video-Generative Value Model for Robot Reinforcement Learning / Jindi Lv, Hao Li, Jie Li 他
日本語で読む → - 論文安全制御/強化学習制御
敵対的強化学習による最大ロバスト制御バリア関数の合成と展開
一般の非線形システムに対して、動的計画法とQ関数を用いた新しいロバスト制御バリア関数を提案し、敵対的強化学習で合成・展開する手法を導入した。
原題: Synthesis and Deployment of Maximal Robust Control Barrier Functions through Adversarial Reinforcement Learning / Donggeon David Oh, Duy P. Nguyen, Haimin Hu 他
日本語で読む → - 論文強化学習/ロバスト制御機械学習
動的不確実性下でのロバストな敵対的方策最適化
強化学習の方策が訓練時と異なる動的環境で失敗する問題に対し、双対問題に基づく温度パラメータを敵対的ネットワークで近似し、軌道レベルとモデルレベルの両方で敵対的サンプリングを行うロバストな方策最適化手法を提案した。
原題: Robust Adversarial Policy Optimization Under Dynamics Uncertainty / Mintae Kim, Koushil Sreenath
日本語で読む → - 論文ロボット操作/強化学習ロボティクス
クリップ付き目的関数による後方最適化:生成的方策学習における効率と安定性の橋渡し
ロボット操作のための生成的方策をRLで微調整する際の不安定性とサンプル非効率を解決するため、後方推論として方策改善を定式化するPOCOフレームワークを提案。期待値最大化手順で報酬重み付き暗黙後方を方策に蒸留し、オフラインからオンラインへのパラダイムで事前分布に探索を固定する。
原題: Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning / Yuhui Chen, Haoran Li, Zhennan Jiang 他
日本語で読む → - 論文協調運転/拡散モデル/強化学習ロボティクス
SCORP: 協調運転のためのシーン整合型マルチエージェント拡散計画と安定なオンライン強化学習後訓練
協調運転向けに、シーン整合性を高めたマルチエージェント拡散プランナーを提案し、安定なオンライン強化学習後訓練を実現した。
原題: SCORP: Scene-Consistent Multi-agent Diffusion Planning with Stable Online Reinforcement Post-Training for Cooperative Driving / Haojie Bai, Aimin Li, Ruoyu Yao 他
日本語で読む → - 論文進化ロボティクス/強化学習機械学習
ターゲットネットワーク不要の分布価値推定によるロバストな品質多様性最適化
品質多様性(QD)アルゴリズムのサンプル効率を改善するため、ターゲットネットワークを使わない分布価値推定を導入した新しいQD-RLアルゴリズムQDHUACを提案し、高次元環境で少ないサンプル数で同等以上の性能を達成した。
原題: Distributional Value Estimation Without Target Networks for Robust Quality-Diversity / Behrad Koohy, Jamie Bayne
日本語で読む →