論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
未知の実行可能性を持つパラメータロバスト回避問題を強化学習で解く
強化学習を用いて、安全な方策が存在する初期条件の部分集合を特定しながら、その集合上で到達可能性問題を解く手法FGEを提案した。
原題: Solving Parameter-Robust Avoid Problems with Unknown Feasibility using Reinforcement Learning / Oswin So, Eric Yang Yu, Songyuan Zhang 他
日本語で読む → - 論文逆強化学習ロボティクス
オンライン世界モデリングによる観察からの実世界逆強化学習
オンライン世界モデルを用いて、実世界のロボットが観察(動画)のみから視覚的マニピュレーションを逆強化学習で学習する手法を提案し、ピックアンドプレースを40分未満で82%の成功率まで達成した。
原題: Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation / Tyler Han, Bat Nemekhbold, Siyang Shen 他
日本語で読む → - 論文強化学習/ナビゲーションロボティクス
ManeuverNet: ダブルアクカーマン操舵ロボットの精密操縦のための報酬関数最適化を伴うSoft Actor-Criticフレームワーク
農業向けダブルアクカーマン操舵ロボットの精密操縦のため、Soft Actor-CriticとCrossQを組み合わせた深層強化学習フレームワークを提案し、4つの専用報酬関数で専門家データなしに学習を実現した。
原題: ManeuverNet: A Soft Actor-Critic Framework for Precise Maneuvering of Double-Ackermann-Steering Robots with Optimized Reward Functions / Kohio Deflesselle, Mélodie Daniel, Aly Magassouba 他
日本語で読む → - 論文強化学習/報酬設計機械学習
生成的エピソードガイダンスによる二重粒度コントラスト報酬で効率的な身体性RL
大規模動画生成モデルを活用し、少数の専門家動画から各RLエピソード用のタスクガイダンスを生成して、粗い探索と細かいマッチングを両立する二重粒度コントラスト報酬を与えることで、人手アノテーションなしにサンプル効率の高い身体性強化学習を実現した研究。
原題: Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL / Xin Liu, Yixuan Li, Yuhui Chen 他
日本語で読む → - 論文強化学習機械学習
確率的環境のための分布型価値勾配
確率的環境でも機能するよう、価値関数の分布だけでなくその勾配の分布もモデル化する分布型ソボレフ訓練を提案し、MuJoCoで有効性を示した。
原題: Distributional value gradients for stochastic environments / Baptiste Debes, Tinne Tuytelaars
日本語で読む → - 論文モデルベース強化学習機械学習
観測からイベントへ:強化学習のためのイベント認識型ワールドモデル
人間が連続的な知覚をイベントに区切って意思決定する仕組みに着想を得て、生の観測から自動でイベント境界を抽出し、イベント予測で表現を学習するワールドモデルEAWMを提案。複数のベンチマークでMBRLの性能を10〜45%向上させた。
原題: From Observations to Events: Event-Aware World Model for Reinforcement Learning / Zhao-Han Peng, Shaohui Li, Zhi Li 他
日本語で読む → - 論文選好ベース強化学習機械学習
信頼・不信・反転:複数専門家フィードバックによる頑健な選好ベース強化学習
複数のアノテータからの選好フィードバックを統合し、各専門家の信頼度を学習して敵対的フィードバックを自動的に反転・活用する選好ベース強化学習フレームワークを提案。
原題: Trust, Don't Trust, or Flip: Robust Preference-Based Reinforcement Learning with Multi-Expert Feedback / Seyed Amir Hosseini, Maryam Abdolali, Amirhosein Tavakkoli 他
日本語で読む → - 論文マルチエージェント強化学習AI
パズルを解くように:オフライン協調強化学習のための局所から大域への世界モデル
マルチエージェント系の局所予測から大域状態を推定する世界モデルを構築し、不確実性を考慮した合成データでオフライン強化学習の汎化性能を高める手法を提案。
原題: Puzzle it Out: Local-to-Global World Model for Offline Multi-Agent Reinforcement Learning / Sijia Li, Xinran Li, Shibo Chen 他
日本語で読む → - 論文多目的強化学習機械学習
後知恵選好リプレイによる選好条件付き多目的強化学習の改善
多目的強化学習において、保存された遷移を別の選好で再ラベル付けする後知恵選好リプレイ(HPR)を提案し、CAPQLの性能を向上させた。
原題: Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning / Jonaid Shianifar, Michael Schukat, Karl Mason
日本語で読む → - 論文拡散方策/強化学習機械学習
二分的拡散方策最適化
拡散方策の強化学習において、報酬最大化と最小化の二つの方策に分解し、推論時にスコアを線形結合することで安定かつ制御可能な最適化を実現する手法を提案。
原題: Dichotomous Diffusion Policy Optimization / Ruiming Liang, Yinan Zheng, Kexin Zheng 他
日本語で読む → - 論文安全強化学習制御
安全な強化学習のための自己組織化デュアルバッファ適応クラスタリング経験リプレイ(SODACER)
最近の経験に素早く適応するFast-Bufferと、自己組織化適応クラスタリングで多様な履歴を保持するSlow-Bufferを組み合わせ、制御バリア関数とSophia最適化を統合した安全な強化学習フレームワークを提案。
原題: Self-Organizing Dual-Buffer Adaptive Clustering Experience Replay (SODACER) for Safe Reinforcement Learning in Optimal Control / Roya Khalili Amirabadi, Mohsen Jalaeian Farimani, Omid Solaymani Fard
日本語で読む → - 論文強化学習機械学習
Enhanced-FQL(λ):新規ファジィ適格度トレースと分割経験再生による効率的で解釈可能な強化学習
ファジィルールベースを用いた強化学習に、ファジィ化ベルマン方程式と適格度トレース、分割経験再生を組み合わせ、連続制御タスクでサンプル効率と安定性を向上させた手法を提案。
原題: Enhanced-FQL($\lambda$), an Efficient and Interpretable RL with novel Fuzzy Eligibility Traces and Segmented Experience Replay / Mohsen Jalaeian-Farimani, Xiong Xiong, Luca Bascetta
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
隣接エージェント行動推定によるマルチエージェント強化学習
各エージェントが局所情報のみから隣接エージェントの行動を推定する軽量モジュールを導入し、明示的な行動共有なしに協調方策を学習するTD3互換のフレームワークを提案。双腕ロボットの協調物体持ち上げタスクで有効性を実証した。
原題: Multiagent Reinforcement Learning with Neighbor Action Estimation / Zhenglong Luo, Zhiyong Chen, Aoxiang Liu
日本語で読む → - 論文強化学習/探索機械学習
価値誘導フローによる高次元連続制御のスケーラブルな探索
価値関数が誘導する確率フローに沿ってネイティブな高次元行動空間で探索を行う強化学習手法Qflexを提案し、高次元連続制御ベンチマークや全身筋骨格モデルの俊敏な運動制御で優れた性能を示した。
原題: Scalable Exploration for High-Dimensional Continuous Control via Value-Guided Flow / Yunyue Wei, Chenhui Zuo, Yanan Sui
日本語で読む → - 論文強化学習機械学習
QUBO最適化による量子インスパイア型エピソード選択を用いたモンテカルロ強化学習
モンテカルロ強化学習のエピソード選択をQUBO問題として定式化し、量子インスパイア型サンプラーで解くことで、報酬最大化と状態空間カバレッジを両立させ、収束速度と方策品質を改善した。
原題: Quantum-Inspired Episode Selection for Monte Carlo Reinforcement Learning via QUBO Optimization / Hadi Salloum, Ali Jnadi, Yaroslav Kholodov 他
日本語で読む → - 論文強化学習機械学習
RN-D: オンポリシー強化学習のための離散化カテゴリカルアクター
連続制御のオンポリシー強化学習において、ガウス分布アクターの代わりに各行動次元を離散ビン上の分布として表現するカテゴリカルアクターと正則化ネットワークを組み合わせ、ベンチマークで最先端性能を達成した。
原題: RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning / Yuexin Bian, Jie Feng, Tao Wang 他
日本語で読む → - 論文強化学習/メタ学習機械学習
効率的探索のための教師なし学習:自己設定目標による適応的方策の事前学習
エージェントが自ら目標を設定・追求して効率的な探索と適応を学ぶ教師なしメタ学習手法ULEEを提案し、新規タスクへのゼロショット・少数ショット性能を向上させた。
原題: Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals / Octavio Pappalardo
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
構造化・非構造化空域における間隔確保のためのTransformerベースマルチエージェント強化学習
相対極座標状態空間でTransformerエンコーダを訓練し、多様な交通パターンと交差角に適応する航空機の間隔確保手法を提案。単一エンコーダ構成が深い構成より優れ、衝突リスクをほぼゼロにした。
原題: Transformer-based Multi-agent Reinforcement Learning for Separation Assurance in Structured and Unstructured Airspaces / Arsyi Aziz, Peng Wei
日本語で読む → - 論文移動ロボット/強化学習ロボティクス
階層学習フレームワークによる移動ロボットの視覚ベース目標到達制御
ステレオ視による自己位置推定と強化学習ベースの運動計画、アクチュエータレベルのロバスト適応制御を組み合わせ、大型スキッドステアロボットの安全な目標到達を実現する階層フレームワークを提案した。
原題: Vision-based Goal-Reaching Control for Mobile Robots Using a Hierarchical Learning Framework / Mehdi Heydari Shahna, Pauli Mustalahti, Jouni Mattila
日本語で読む → - 論文拡散方策/強化学習機械学習
拡張可能なロボット制御のためのオンライン拡散方策強化学習アルゴリズムのレビュー
拡散方策とオンライン強化学習を組み合わせたアルゴリズムを4系統に分類し、12タスクで性能を比較評価した初の体系的レビュー。
原題: A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control / Wonhyeok Choi, Shutong Ding, Minwoo Choi 他
日本語で読む → - 論文安全強化学習機械学習
方策事前分布による安全な探索
保守的な方策を事前分布として利用し、確率的ダイナミクスモデルで安全を保証しながら最適方策へ収束する強化学習手法SOOPERを提案した。
原題: Safe Exploration via Policy Priors / Manuel Wendl, Yarden As, Manish Prajapat 他
日本語で読む → - 論文強化学習/安全制御ロボティクス
目標到達強化学習に対する進捗保証付き可逆シンプレックス監督
凍結有限状態方策と目標レベルのロバスト適応回復を組み合わせた可逆シンプレックス枠組みを提案し、外側丸め到達可能性検証と進捗負債の明示的会計により、有限切替と有限サンプル目標到達を保証する。
原題: Progress-Certified Reversible Simplex Supervision of Goal-Reaching Reinforcement Learning / Mehdi Heydari Shahna, Jouni Mattila
日本語で読む → - 論文ヒューマン・イン・ザ・ループ強化学習ロボティクス
E2HiL: エントロピー誘導サンプル選択による効率的な実世界ヒューマン・イン・ザ・ループ強化学習
方策エントロピーへの影響度を推定し、有益なサンプルを能動的に選ぶことで、人手介入を減らしつつ実世界マニピュレーションタスクの学習を効率化するヒューマン・イン・ザ・ループ強化学習フレームワークを提案した。
原題: E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning / Haoyuan Deng, Yuanjiang Xue, Haoyang Du 他
日本語で読む → - 論文航空管制/強化学習機械学習
オンライン行動スタッキングによる航空管制の強化学習性能向上
強化学習で航空管制を学習する際、推論時に基本行動を組み合わせて複合的な管制指示を生成するオンライン行動スタッキングを提案し、小さな行動空間でも実用的な性能を実現した。
原題: Online Action-Stacking Improves Reinforcement Learning Performance for Air Traffic Control / Ben Carvell, George De Ath, Eseoghene Benjamin 他
日本語で読む → - 論文強化学習機械学習
随伴マッチングによるQ学習
拡散・フローマッチング方策をQ関数で効率的に最適化するため、随伴マッチングを活用したTDベース強化学習手法QAMを提案し、疎な報酬タスクで従来法を上回る性能を示した。
原題: Q-learning with Adjoint Matching / Qiyang Li, Sergey Levine
日本語で読む → - 論文強化学習セキュリティロボティクス
バックドアが部分観測性と出会うとき:実世界強化学習への攻撃
実世界の強化学習ではLiDARやオドメトリなど制御不能な補助状態が混在するため、条件付き拡散で確率的トリガー分布を学習し、視覚パッチによるバックドア攻撃を安定して発動させる手法を提案した。
原題: When Backdoors Meet Partial Observability: Attacking Real-World Reinforcement Learning / Tairan Huang, Qingqing Ye, Yulin Jin 他
日本語で読む → - 論文オフライン強化学習機械学習
静的データセットを超えて:検証済み合成遷移による堅牢なオフライン方策最適化
二重再帰ワールドモデルで合成遷移を生成し、VAE・感度分析・MCドロップアウトの階層的不確実性フィルタで検証することで、オフライン強化学習の性能を向上させる手法MoReBRACを提案した。
原題: Beyond Static Datasets: Robust Offline Policy Optimization via Vetted Synthetic Transitions / Pedram Agand, Mo Chen
日本語で読む → - 論文モデルベース強化学習AI
オブジェクト中心の世界モデルとモンテカルロ木探索の融合
物体間の相互作用をグラフニューラルネットで捉えるオブジェクト中心の世界モデルを構築し、モンテカルロ木探索による計画と組み合わせた強化学習手法ObjectZeroを提案した。
原題: Object-Centric World Models Meet Monte Carlo Tree Search / Rodion Vakhitov, Leonid Ugadiarov, Aleksandr Panov
日本語で読む → - 論文安全強化学習機械学習
ナイトメア・ドリーマー:危険状態を夢見て先回りする安全強化学習
学習した世界モデルで将来の安全違反を予測し、それを避けるように行動計画を立てるモデルベース安全強化学習手法を提案。画像入力のみで安全性と効率を大幅に改善した。
原題: Nightmare Dreamer: Dreaming About Unsafe States And Planning Ahead / Oluwatosin Oseni, Shengjie Wang, Jun Zhu 他
日本語で読む → - 論文オフライン強化学習機械学習
ロバストなスタイル整合下での高品質行動のオフライン強化学習
サブ軌跡ラベルによるスタイル監督を用いたオフライン強化学習において、スタイルとタスク性能の両立を図るSCIQLを提案し、従来手法より優れた性能を示した。
原題: Offline Reinforcement Learning of High-Quality Behaviors Under Robust Style Alignment / Mathieu Petitbois, Rémy Portelas, Sylvain Lamprier
日本語で読む →