論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/世界モデル/強化学習ロボティクス
WorldRFT: 強化学習ファインチューニングによる潜在世界モデル計画法
自動運転向けに、シーン表現学習を計画タスクに整合させる階層的計画分解と局所的な反復改善を導入し、GRPOによる強化学習ファインチューニングで安全性を高めた潜在世界モデルフレームワークを提案。nuScenesとNavSimでSOTA性能を達成。
原題: WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving / Pengxuan Yang, Ben Lu, Zhongpu Xia 他
日本語で読む → - 論文強化学習ロボティクス
Symphony: ヒューマノイドロボットのためのヒューリスティック正規化較正アドバンテージアクター・クリティックアルゴリズム
ヒューマノイドロボットをゼロから効率的かつ安全に学習させるため、弱いパラメトリックノイズとアクション強度の抑制、および双曲線正接を用いたフェーディングリプレイバッファを組み合わせたアクター・クリティック手法を提案。
原題: Symphony: A Heuristic Normalized Calibrated Advantage Actor and Critic Algorithm in application for Humanoid Robots / Timur Ishuov, Michele Folgheraiter, Madi Nurmanov 他
日本語で読む → - 論文強化学習ロボティクス
マルチティーチャー学習における保守的バイアス:エージェントが低報酬アドバイザーを好む理由
複数の教師がいる強化学習で、エージェントは高報酬の教師よりも一貫性のある低報酬の教師を圧倒的に選ぶことを実験的に示し、その性能限界と応用可能性を議論した。
原題: Conservative Bias in Multi-Teacher Learning: Why Agents Prefer Low-Reward Advisors / Maher Mesto, Francisco Cruz
日本語で読む → - 論文目標条件付き強化学習機械学習
アイコナール制約付き階層的準距離強化学習による目標到達
目標到達タスクをアイコナール方程式で連続時間化した準距離強化学習(Eik-QRL)を提案し、さらに階層化したEik-HiQRLでナビゲーションやマニピュレーションの性能を向上させた論文。
原題: Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning / Vittorio Giammarino, Ahmed H. Qureshi
日本語で読む → - 論文モデルベース強化学習機械学習
勾配ベース計画のための世界モデルにおける訓練・テストギャップの解消
世界モデルの訓練時とテスト時の目的のずれを埋めるため、訓練時のデータ合成手法を提案し、勾配ベース計画の性能を向上させた。物体操作やナビゲーションタスクで、従来のCEMと同等以上の性能を10%の時間で達成した。
原題: Closing the Train-Test Gap in World Models for Gradient-Based Planning / Arjun Parthasarathy, Nimit Kalra, Rohun Agrawal 他
日本語で読む → - 論文制御/強化学習ロボティクス
TD3によるツインロータ航空システムの制御
強化学習アルゴリズムTD3を用いてツインロータ航空システムの姿勢制御と軌道追従を行い、外乱下でのPID制御との比較や実機実験で有効性を確認した論文。
原題: Control of a Twin Rotor using Twin Delayed Deep Deterministic Policy Gradient (TD3) / Zeyad Gamal, Youssef Mahran, Ayman El-Badawy
日本語で読む → - 論文強化学習/制御ロボティクス
強化学習による低レベルクアッドコプター制御における動的エントロピーチューニング:確率性と決定性の比較
強化学習でクアッドコプターを制御する際、動的エントロピーチューニングが確率的方策の性能を向上させ、壊滅的忘却を防ぎ探索効率を高めることを示した。
原題: Dynamic Entropy Tuning in Reinforcement Learning Low-Level Quadcopter Control: Stochasticity vs Determinism / Youssef Mahran, Zeyad Gamal, Ayman El-Badawy
日本語で読む → - 論文マルチエージェント強化学習cs.MA
信念不一致と限られた通信下でのDec-POMDPにおける最適性能と行動一貫性の保証に向けて
各エージェントが異なる信念を持つ分散型POMDPにおいて、信念の不一致を考慮した最適な共同行動選択フレームワークを提案し、行動一貫性と性能の確率的保証を提供するとともに、必要な時のみ通信をトリガーする手法を開発した。
原題: Towards Optimal Performance and Action Consistency Guarantees in Dec-POMDPs with Inconsistent Beliefs and Limited Communication / Moshe Rafaeli Shimron, Vadim Indelman
日本語で読む → - 論文マルチエージェント強化学習機械学習
MOMA-AC: 選好駆動型アクター・クリティックによる連続多目的マルチエージェント強化学習
連続状態・行動空間の多目的マルチエージェント強化学習向けに、選好条件付けと集中型クリティックを組み合わせたアクター・クリティック枠組みを提案し、TD3/DDPGに適用して協調歩行タスクで有効性を示した。
原題: MOMA-AC: A preference-driven actor-critic framework for continuous multi-objective multi-agent reinforcement learning / Adam Callaghan, Karl Mason, Patrick Mannion
日本語で読む → - 論文強化学習/世界モデル機械学習
因果関係を考慮した強化学習のためのオブジェクト中心の世界モデル
観測をオブジェクト単位のトークンに分解し、Transformerベースの世界モデルと因果関係を考慮した方策・価値ネットワークを統合したSTICAを提案。物体が多い環境での強化学習において、サンプル効率と最終性能で既存手法を上回ることを示した。
原題: Object-Centric World Models for Causality-Aware Reinforcement Learning / Yosuke Nishimoto, Takashi Matsubara
日本語で読む → - 論文オフライン強化学習stat.ML
連続時間オフライン強化学習のための作用素モデル
連続時間の制御拡散過程を再生核ヒルベルト空間で学習し、作用素論に基づく動的計画法でオフライン強化学習の価値関数の大域的収束と有限サンプル保証を与えた論文。
原題: Operator Models for Continuous-Time Offline Reinforcement Learning / Nicolas Hoischen, Petar Bevanda, Max Beier 他
日本語で読む → - 論文強化学習/世界モデル機械学習
注目を学ぶ:部分観測強化学習における構造的注意機構による情報履歴の優先
Transformerベースの世界モデルにガウス分布的な注意の事前分布を導入し、部分観測下の強化学習で重要な遷移に柔軟に注目させることで性能を大幅に改善した。
原題: Learning to Focus: Prioritizing Informative Histories with Structured Attention Mechanisms in Partially Observable Reinforcement Learning / Daniel De Dios Allegue, Jinke He, Frans A. Oliehoek
日本語で読む → - 論文物体中心強化学習機械学習
物体中心強化学習のためのインタラクティブ世界モデル学習
物体とその相互作用を構造化して表現する世界モデルを提案し、階層的方策と組み合わせることで、サンプル効率と汎化性能を向上させた。
原題: Learning Interactive World Model for Object-Centric Reinforcement Learning / Fan Feng, Phillip Lippe, Sara Magliacane
日本語で読む → - 論文強化学習機械学習
セマンティックセグメンテーションによる3D環境での強化学習の強化:ViZDoomでのケーススタディ
ViZDoomのデスマッチで、RGB画像にセマンティックセグメンテーションを適用した入力表現(SSのみ、RGB+SS)を提案し、メモリ消費の削減と性能向上を実証した。
原題: Enhancing Reinforcement Learning in 3D Environments through Semantic Segmentation: A Case Study in ViZDoom / Jin Huang
日本語で読む → - 論文強化学習ロボティクス
統一的な表現力豊かな方策最適化による堅牢なロボット学習に向けて
大規模言語モデルの事前学習・微調整に着想を得た生成フレームワークUEPOを提案し、マルチモーダル行動の獲得とオンライン適応時の分布シフトに対処して、D4RLベンチマークで移動・巧みな操作タスクの性能を大幅に向上させた。
原題: Opinion: Towards Unified Expressive Policy Optimization for Robust Robot Learning / Haidong Huang, Haiyue Zhu. Jiayu Song, Xixin Zhao 他
日本語で読む → - 論文マルチタスク強化学習機械学習
大規模マルチタスク世界モデルによる連続制御の学習
200の多様なタスクで言語条件付き世界モデルを事前学習し、オンライン強化学習で微調整することで、マルチタスク性能とデータ効率を向上させた研究。
原題: Learning Massively Multitask World Models for Continuous Control / Nicklas Hansen, Hao Su, Xiaolong Wang
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
ソフトロボットアームの集中型・分散型強化学習制御の定量的比較
Cosseratロッドでモデル化したソフトロボットアームの制御において、集中型PPOと分散型MAPPOを制御区分数nを変えながら比較し、nが小さい場合は集中型、nが大きい場合は分散型がサンプル効率やロバスト性で優れることを示した。
原題: A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms / Linxin Hou, Qirui Wu, Zhihang Qin 他
日本語で読む → - 論文モデルベース強化学習機械学習
世界モデルを用いたオフポリシー・ブートストラップ強化学習
世界モデルでプランナーを学習し、その行動をオフポリシー学習で方策に蒸留するブートストラップループにより、サンプル効率と性能を両立させる手法BOOMを提案。
原題: Bootstrap Off-policy with World Model / Guojian Zhan, Likun Wang, Xiangteng Zhang 他
日本語で読む → - 論文VIO/強化学習ロボティクス
適応的でコストを意識した視覚慣性オドメトリのためのデュアルエージェント強化学習
視覚慣性オドメトリにおいて、視覚フロントエンドをいつ実行しその出力をどれだけ信頼するかを強化学習エージェントで逐次決定し、精度と計算効率のトレードオフを改善する手法を提案。
原題: Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry / Feiyang Pan, Shenghe Zheng, Chunyan Yin 他
日本語で読む → - 論文強化学習機械学習
有界サポート進化戦略による方策改善
有界な三角分布ノイズと中心化ランク有限差分推定を組み合わせたTD-ESを提案し、PPO事前学習後の方策改善で成功率を26.5%向上させた。
原題: Harnessing Bounded-Support Evolution Strategies for Policy Refinement / Ethan Hirschowitz, Fabio Ramos
日本語で読む → - 論文目標条件付き強化学習機械学習
スケーラブルな目標条件付き強化学習のためのマルチステップ準距離学習
マルチステップモンテカルロリターンを用いて準距離を学習するオフライン目標条件付き強化学習手法を提案し、長期的な視覚タスクや実世界のロボット操作で有効性を示した。
原題: Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning / Bill Chunyuan Zheng, Vivek Myers, Benjamin Eysenbach 他
日本語で読む → - 論文逆強化学習ロボティクス
Masked IRL: LLMによるデモンストレーションと言語からの報酬曖昧性解消
言語指示から状態の重要度マスクを推定し、LLMで曖昧な指示を明確化することで、少ないデータで報酬関数を学習する手法を提案。
原題: Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language / Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler 他
日本語で読む → - 論文逆強化学習機械学習
BiCQL-ML:最大尤度逆強化学習のための二段階保守的Q学習フレームワーク
オフラインのデモデータのみから報酬関数を推定する逆強化学習手法を提案し、報酬と保守的Q関数を二段階で交互最適化することで、既存手法より精度良く報酬を復元できることを示した。
原題: BiCQL-ML: A Bi-Level Conservative Q-Learning Framework for Maximum Likelihood Inverse Reinforcement Learning / Junsung Park
日本語で読む → - 論文強化学習AI
行動量子化と軌道最適化による人間らしい強化学習エージェントの学習
人間のデモをベクトル量子化VAEでマクロ行動に蒸留し、軌道最適化として人間らしさを定式化することで、報酬最大化と人間類似行動を両立する強化学習フレームワークMAQを提案した。
原題: Learning Human-Like RL Agents Through Trajectory Optimization With Action Quantization / Jian-Ting Guo, Yu-Cheng Chen, Ping-Chun Hsieh 他
日本語で読む → - 論文強化学習機械学習
オンライン相互作用を用いた分布ロバストなオフダイナミクス強化学習のサンプル複雑度
訓練環境と展開環境の動学が異なる状況で、オンライン相互作用のみを用いたロバスト強化学習のサンプル複雑度を解析し、最適な後悔界を達成する効率的アルゴリズムを提案した。
原題: Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction / Yiting He, Zhishuai Liu, Weixin Wang 他
日本語で読む → - 論文ヒューマノイド/強化学習ロボティクス
ヒューマノイドロボットのための視覚駆動型リアクティブサッカースキルの学習
視覚知覚と運動制御を直接統合した強化学習コントローラを提案し、ヒューマノイドロボットが実環境でリアクティブなサッカースキルを獲得できるようにした。
原題: Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots / Yushi Wang, Changsheng Luo, Penghui Chen 他
日本語で読む → - 論文強化学習/目標生成ロボティクス
物理法則に基づく目標想像:自己教師あり強化学習のための物理情報変分オートエンコーダ
物理制約をVAEの学習に組み込み、物体の力学と外観を分離した潜在空間で物理的に実現可能な目標を生成するPI-RIGを提案し、自己教師あり強化学習の探索と技能獲得を改善した。
原題: Physically-Grounded Goal Imagination: Physics-Informed Variational Autoencoder for Self-Supervised Reinforcement Learning / Lan Thi Ha Nguyen, Kien Ton Manh, Anh Do Duc 他
日本語で読む → - 論文飛行/強化学習ロボティクス
点群から動作へ:動的障害物環境を流れ支援で飛行する
LiDARの点群から環境変化を捉える点流れを抽出し、強化学習で動的障害物を回避する自律飛行システムを構築した。
原題: Flow-Aided Flight Through Dynamic Clutters From Point To Motion / Bowen Xu, Zexuan Yan, Minghao Lu 他
日本語で読む → - 論文V2X/マルチエージェント強化学習ロボティクス
Z-Merge: ゾーン別V2X情報を活用したマルチエージェント強化学習による合流制御
路側機からのゾーン別グローバル情報をV2X通信で共有し、マルチエージェント強化学習で自動運転車の合流を制御する枠組みを提案。合流成功率・交通効率・安全性を向上させる。
原題: Z-Merge: Multi-Agent Reinforcement Learning for On-Ramp Merging with Zone-Specific V2X Traffic Information / Yassine Ibork, Myounggyu Won, Lokesh Das
日本語で読む → - 論文経路計画/マルチエージェント強化学習ロボティクス
動的環境におけるマルチエージェント強化学習による経路計画
環境変化が局所的に起こる動的環境で、領域分割と分散強化学習エージェントにより経路計画を行う手法を提案し、連合Q学習が単一エージェントを上回ることを示した。
原題: Path Planning through Multi-Agent Reinforcement Learning in Dynamic Environments / Jonas De Maeyer, Hossein Yarahmadi, Moharram Challenger
日本語で読む →