論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/1/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
RN-D: オンポリシー強化学習のための離散化カテゴリカルアクター
連続制御のオンポリシー強化学習において、ガウス分布アクターの代わりに各行動次元を離散ビン上の分布として表現するカテゴリカルアクターと正則化ネットワークを組み合わせ、ベンチマークで最先端性能を達成した。
原題: RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning / Yuexin Bian, Jie Feng, Tao Wang 他
日本語で読む → - 論文強化学習機械学習
QUBO最適化による量子インスパイア型エピソード選択を用いたモンテカルロ強化学習
モンテカルロ強化学習のエピソード選択をQUBO問題として定式化し、量子インスパイア型サンプラーで解くことで、報酬最大化と状態空間カバレッジを両立させ、収束速度と方策品質を改善した。
原題: Quantum-Inspired Episode Selection for Monte Carlo Reinforcement Learning via QUBO Optimization / Hadi Salloum, Ali Jnadi, Yaroslav Kholodov 他
日本語で読む → - 論文継続強化学習機械学習
動的環境におけるデモンストレーション誘導型継続強化学習
過去の知識を自己進化するデモンストレーションリポジトリに保存し、それを直接活用して探索と適応を導く継続強化学習手法を提案。2DナビゲーションとMuJoCoで性能・知識転移・忘却抑制・効率の向上を示した。
原題: Demonstration-Guided Continual Reinforcement Learning in Dynamic Environments / Xue Yang, Michael Schukat, Junlin Lu 他
日本語で読む → - 論文強化学習AI
世界モデルが強化学習エージェントの最適採餌戦略を実現する
学習した世界モデルを持つ人工採餌エージェントが、限界価値定理に沿ったパッチ離脱行動を自然に獲得することを示し、予測的世界モデルが生物学的に妥当な意思決定の基盤となる可能性を提示した。
原題: World Models Unlock Optimal Foraging Strategies in Reinforcement Learning Agents / Yesid Fonseca, Manuel S. Ríos, Nicanor Quijano 他
日本語で読む → - 論文オフライン強化学習機械学習
明示的な保守性なしの長期ホライズンモデルベースオフライン強化学習
ベイズ的アプローチにより明示的な保守性を使わずに長期ホライズンのロールアウトを可能にし、D4RLとNeoRLで最先端性能を達成したNEUBAYを提案。
原題: Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism / Tianwei Ni, Esther Derman, Vineet Jain 他
日本語で読む → - 論文強化学習/生成ポリシー機械学習
事前分布マッピング共進化による拡散ポリシーの学習
強化学習において、最適化しやすい潜在空間で方策を訓練しつつ、条件付き生成デコーダで行動を合成するフレームワークGoRLを提案。複雑な連続制御タスクで既存手法を大幅に上回る性能を達成した。
原題: Training Diffusion Policies via Prior-Mapping Co-Evolution / Chubin Zhang, Zhenglin Wan, Feng Chen 他
日本語で読む → - 論文ニューロモーフィック/強化学習ロボティクス
Intel Loihi 2ニューロモーフィックハードウェアによる自律強化学習ロボット制御
シミュレーションで訓練した強化学習方策をスパイキングニューラルネットワークに変換し、Intel Loihi 2上でAstrobeeロボットの制御を実現した。
原題: Autonomous Reinforcement Learning Robot Control with Intel's Loihi 2 Neuromorphic Hardware / Kenneth Stewart, Roxana Leontie, Samantha Chapin 他
日本語で読む → - 論文安全強化学習機械学習
サンプリングベースの重み空間射影による制約付き方策最適化
微分不可能な安全制約をサンプリングで評価し、パラメータ空間で射影することで、安全性を保ちながら方策を改善する手法SCPOを提案した。
原題: Constrained Policy Optimization via Sampling-Based Weight-Space Projection / Shengfan Cao, Francesco Borrelli, Eunhyek Joa
日本語で読む → - 論文制御/強化学習機械学習
リアプノフ証明を用いたマルチステップアクター・クリティック学習による指数安定化制御
オフポリシー最大エントロピー強化学習に指数安定性を統合し、マルチステップサンプルとリアプノフ証明で効率的に安定化制御を学習する手法を提案。
原題: MSACL: Multi-Step Actor-Critic Learning with Lyapunov Certificates for Exponentially Stabilizing Control / Yongwei Zhang, Yuanzhe Xing, Quanyi Liang 他
日本語で読む → - 論文強化学習/流体制御AI
強化学習で技能獲得におけるフィードバックの役割を探る
回転円柱を水中に置き、強化学習エージェントに抗力の最大化・最小化を学習させた結果、流れのフィードバックなしでも同じ行動系列で同等の性能が得られ、技能実行にフィードバックは必須でないことを示した。
原題: Using reinforcement learning to probe the role of feedback in skill acquisition / Antonio Terpin, Raffaello D'Andrea
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
IPPOはチームではなくゲームを学ぶ:異種エージェントチームにおける汎化の研究
異種エージェント環境で、自己対戦PPO(IPPO)が未知のチームメイトアルゴリズムに汎化できるかを検証し、多様なチームメイトに触れるRotating Policy Trainingと同等の性能を示した。
原題: IPPO Learns the Game, Not the Team: A Study on Generalization in Heterogeneous Agent Teams / Ryan LeRoy, Jack Kolb
日本語で読む → - 論文強化学習/フォトニックコンピューティングロボティクス
ロボット連続制御のためのフォトニックスパイキング強化学習のハードウェア・ソフトウェア協調コンピューティング
光スパイキング強化学習(TD3とSNNの融合)をシリコンフォトニックMZIチップで実行するハードウェア・ソフトウェア協調推論システムを提案し、ロボット連続制御タスクで高効率・低遅延を実現した。
原題: Hardware-Software Collaborative Computing of Photonic Spiking Reinforcement Learning for Robotic Continuous Control / Mengting Yu, Shuiying Xiang, Changjian Xie 他
日本語で読む → - 論文メタ強化学習ロボティクス
行動に依存しないTransformerエンコーダ・デコーダによるメタ強化学習のための文脈表現
状態と報酬の系列のみからタスク表現を推論する信念モデルCRAFTを提案し、行動情報を必要とせずタスク推論と方策最適化を分離することで、メタ強化学習における適応速度と汎化性能を向上させた。
原題: Context Representation via Action-Free Transformer encoder-decoder for Meta Reinforcement Learning / Amir M. Soufi Enayati, Homayoun Honari, Homayoun Najjaran
日本語で読む → - 論文強化学習ロボティクス
深層強化学習によるヒューマノイドロボットの自己保護転倒ポリシーの発見
深層強化学習とカリキュラム学習を用いて、ヒューマノイドロボットが転倒時に自己保護するためのポリシーを学習させ、三角形の姿勢を形成することで損傷を大幅に低減できることを発見し、実機に転移した。
原題: Discovering Self-Protective Falling Policy for Humanoid Robot via Deep Reinforcement Learning / Diyuan Shi, Shangke Lyu, Donglin Wang
日本語で読む → - 論文強化学習/ドッキング/微小重力ロボティクス
微小重力環境における6自由度ドッキングのための強化学習:ISS-JEM内のInt-Ball2を用いたシミュレーション研究
JAXAのInt-Ball2ロボットの6自由度ドッキングを、Isaac Sim上の高忠実度JEMモデルでPPOを用いて強化学習し、ドメインランダム化と観測ノイズ下で安定したドッキングを実現した。
原題: Reinforcement Learning based 6-DoF Maneuvers for Microgravity Intravehicular Docking: A Simulation Study with Int-Ball2 in ISS-JEM / Aman Arora, Matteo El-Hariry, Miguel Olivares-Mendez
日本語で読む → - 論文オフライン強化学習/計画ロボティクス
降下としての計画:学習されたエネルギー地形における目標条件付き潜在軌道合成
オフライン目標条件付き強化学習において、潜在軌道全体に対するエネルギー関数を学習し、勾配降下による軌道精錬として計画を行う手法を提案。キューブ操作タスクで95%の成功率を達成した。
原題: Planning as Descent: Goal-Conditioned Latent Trajectory Synthesis in Learned Energy Landscapes / Carlos Vélez García, Miguel Cazorla, Jorge Pomares
日本語で読む → - 論文宇宙ロボティクス/強化学習ロボティクス
宇宙空間における強化学習による自由飛行ロボットの自律制御:ISSでのAstrobee実証実験
強化学習を用いて国際宇宙ステーション上のAstrobeeロボットを制御し、宇宙空間で初めて自由飛行ロボットの強化学習制御を実証した。
原題: Autonomous Planning In-space Assembly Reinforcement-learning free-flYer (APIARY) International Space Station Astrobee Testing / Samantha Chapin, Kenneth Stewart, Roxana Leontie 他
日本語で読む → - 論文マイクロロボット/強化学習ロボティクス
オンデバイス計算制約下での強化学習によるマイクロロボット制御
サブセンチメートル四足歩行マイクロロボットの強化学習制御を超小型SoC上に実装し、量子化と歩容スケジューリングで電力制約下の推論周波数を最適化した。
原題: Control of Microrobots with Reinforcement Learning under On-Device Compute Constraints / Yichen Liu, Kesava Viswanadha, Zhongyu Li 他
日本語で読む → - 論文強化学習ロボティクス
ノイズを含むセンサ入力からヒューマノイドサッカーロボットの俊敏なキック技能を学習
ノイズの多いセンサ入力下でも、ヒューマノイドロボットが連続してボールを蹴り、多様な配置でゴールを決められる強化学習システムを開発した。
原題: Learning Agile Striker Skills for Humanoid Soccer Robots from Noisy Sensory Input / Zifan Xu, Myoungkyu Seo, Dongmyeong Lee 他
日本語で読む → - 論文メタ強化学習機械学習
学習可能な基底関数を持つ深層ベイズ強化学習における一般化線形モデル
深層ベイズ強化学習において、タスクパラメータとモデルノイズに対する完全に解析可能なベイズ推論と、遷移・報酬モデル学習のための厳密な周辺尤度評価を可能にする一般化線形モデル(GLiBRL)を提案し、MuJoCoとMetaWorldで最大1.8倍の性能向上を達成した。
原題: Generalised Linear Models in Deep Bayesian RL with Learnable Basis Functions / Jingyang You, Hanna Kurniawati
日本語で読む → - 論文オフライン強化学習機械学習
非定常環境におけるオフライン強化学習のための予測手法
オフライン強化学習において、時間変化するずれによる部分観測性に対処するため、拡散モデルによる候補状態生成とゼロショット時系列予測を統合したFORLを提案し、非定常環境での性能向上を実証した。
原題: Forecasting in Offline Reinforcement Learning for Non-stationary Environments / Suzan Ece Ada, Georg Martius, Emre Ugur 他
日本語で読む → - 論文強化学習/ワールドモデルロボティクス
RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
原題: RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL / Yinzhou Tang, Yu Shang, Yinuo Chen 他
日本語で読む → - 論文強化学習AI
強化学習仕様の自動精緻化フレームワークAutoSpec
強化学習の論理仕様を探索に基づいて自動的に精緻化し、複雑なタスクの学習を容易にするフレームワークAutoSpecを提案。
原題: Automating the Refinement of Reinforcement Learning Specifications / Tanmay Ambadkar, Đorđe Žikelić, Abhinav Verma
日本語で読む → - 論文安全強化学習ロボティクス
MPCガイド付き安全強化学習とLipschitz連続性に基づくフィルタリングによる構造化非線形システムの制御
MPCで安全制約をガイドしながら強化学習を行い、展開時はLipschitz連続性に基づく軽量フィルタで安全性を保証する統合フレームワークを提案し、非線形空力弾性翼システムで有効性を示した。
原題: MPC-Guided Safe Reinforcement Learning and Lipschitz-Based Filtering for Structured Nonlinear Systems / Patrick Kostelac, Xuerui Wang, Anahita Jamshidnejad
日本語で読む → - 論文強化学習ロボティクス
深層強化学習と模倣学習の入門
ロボットなどの身体性エージェント向けに、深層強化学習(DRL)と深層模倣学習(DIL)の基礎アルゴリズムを自己完結的に解説した入門資料。
原題: An Introduction to Deep Reinforcement and Imitation Learning / Pedro Santana
日本語で読む → - 論文制御/強化学習ロボティクス
Soft Actor-Criticを用いたクアッドロータの強化学習位置制御
推力ベクトルを直接制御する強化学習エージェントと姿勢PIDを組み合わせ、従来のRPM制御より高速な学習と滑らかな経路追従を実現した。
原題: Reinforcement Learning Position Control of a Quadrotor Using Soft Actor-Critic (SAC) / Youssef Mahran, Zeyad Gamal, Ayman El-Badawy
日本語で読む → - 論文強化学習機械学習
分離型Qチャンキング:批評家と方策のチャンク長を分離した強化学習
批評家のチャンク長と方策のチャンク長を分離し、短い行動チャンクで方策を最適化することで、長期的な目標条件付きタスクにおけるオフライン強化学習の性能を向上させる手法を提案した。
原題: Decoupled Q-Chunking / Qiyang Li, Seohong Park, Sergey Levine
日本語で読む → - 論文自動運転/安全強化学習機械学習
予測的安全表現を用いた安全な自動運転ポリシーの学習
将来の制約違反を予測する安全表現を強化学習に組み込み、自動運転の性能と安全性のトレードオフを改善する手法を実データで検証した。
原題: Learning Safe Autonomous Driving Policies Using Predictive Safety Representations / Mahesh Keswani, Raunak Bhattacharyya
日本語で読む → - 論文強化学習/誘導制御ロボティクス
滑空弾の誘導制御のための強化学習
光学誘導滑空機の制御則を強化学習で構築し、カメラで検出した目標を高精度に追跡・誘導できることを示した研究。
原題: Reinforcement Learning for Gliding Projectile Guidance and Control / Joel Cahn, Antonin Thomas, Philippe Pastor
日本語で読む → - 論文強化学習機械学習
対称性が部分的に破れる環境における部分同変強化学習
対称性が局所的にしか成り立たない環境向けに、対称な箇所だけ群同変ベルマン更新を適用するPI-MDPを提案し、PE-DQNとPE-SACとして実装してサンプル効率と汎化性能を向上させた。
原題: Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments / Junwoo Chang, Minwoo Park, Joohwan Seo 他
日本語で読む →