論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
単一表現で全ての報酬を最適化することは本当に可能か?
強化学習における教師なし事前学習の理論的理解を深め、後退・前進表現学習の新しい変種を提案し、ゼロショット性能を大幅に改善した。
原題: Can We Really Learn One Representation to Optimize All Rewards? / Chongyi Zheng, Royina Karegoudra Jayanth, Benjamin Eysenbach
日本語で読む → - 論文強化学習ロボティクス
正規化フローによるデータ効率的な階層型目標条件付き強化学習
階層型目標条件付き強化学習において、高レベル・低レベルの方策を正規化フローで表現することで、データが少ない状況でも多様な行動を学習できるNF-HIQLを提案した。
原題: Data-Efficient Hierarchical Goal-Conditioned Reinforcement Learning via Normalizing Flows / Shaswat Garg, Matin Moezzi, Brandon Da Silva
日本語で読む → - 論文オフライン強化学習機械学習
ReFORM: ノイズ操作によるサポート上オフライン強化学習のための反射フロー
オフライン強化学習において、フローポリシーを用いてサポート制約を構造的に満たしつつ、反射フローでノイズを操作して性能を最大化する手法を提案。
原題: ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation / Songyuan Zhang, Oswin So, H. M. Sabbir Ahmad 他
日本語で読む → - 論文制御/強化学習制御
クープマン作用素とリアプノフ制約による安全な強化学習
クープマン作用素で誤差ダイナミクスを線形化し、DAREから制御リアプノフ関数を導出してSACに制約として組み込み、軌道追従と安定化を保証する手法を提案。
原題: LC-SAC: Lyapunov-Constrained Soft Actor-Critic via Koopman Operator Theory for Trajectory Tracking and Stabilization / Dhruv S. Kushwaha, Zoleikha A. Biron
日本語で読む → - 論文強化学習/世界モデルロボティクス
効率的な一次強化学習のための局所・大域世界モデルの結合
大規模拡散モデルによる世界モデル内で強化学習を行い、軽量な潜在空間サロゲートで勾配計算を効率化する一次勾配法を提案。Push-Tタスクや四足歩行ロボットの物体操作でPPOを上回るサンプル効率を実現。
原題: Coupled Local and Global World Models for Efficient First Order RL / Joseph Amigo, Rooholla Khorrambakht, Nicolas Mansard 他
日本語で読む → - 論文制御/強化学習ロボティクス
自律走行レースにおけるPure PursuitのパラメータをPPOでオンライン調整
強化学習(PPO)を用いてPure Pursuitの先読み距離とステアリングゲインをオンラインで同時調整し、地図ごとの再調整なしに追従性能を向上させる手法を提案。
原題: Learning to Tune Pure Pursuit in Autonomous Racing: Joint Lookahead and Steering-Gain Control with PPO / Mohamed Elgouhary, Amr S. El-Wakeel
日本語で読む → - 論文強化学習機械学習
因果的報酬整形による交絡に頑健な連続制御
オフラインデータから因果的ベルマン方程式を用いて報酬整形関数を自動学習し、未観測の交絡因子があっても連続制御タスクで安定した性能を実現する手法を提案。
原題: Confounding Robust Continuous Control via Automatic Reward Shaping / Mateo Juliani, Mingxuan Li, Elias Bareinboim
日本語で読む → - 論文強化学習機械学習
制約付きグループ相対方策最適化
GRPOをラグランジュ緩和で拡張し、制約違反率を直接最適化する制約付き方策学習手法を提案。アドバンテージのスカラー化で安定した制約制御を実現し、ロボティクスタスクでの成功率向上も示した。
原題: Constrained Group Relative Policy Optimization / Roger Girgis, Rodrigue de Schaetzen, Luke Rowe 他
日本語で読む → - 論文宇宙ロボティクス/強化学習機械学習
LEOにおける複数デブリ除去ミッションの最適計画:共楕円遷移と燃料補給を考慮した深層強化学習アプローチ
低軌道での複数デブリ除去ミッションにおいて、共楕円マヌーバと燃料補給を組み込んだ枠組みを提案し、Masked PPOによる強化学習が貪欲法やMCTSより効率的に多くのデブリを訪問できることを示した。
原題: Optimal Multi-Debris Mission Planning in LEO: A Deep Reinforcement Learning Approach with Co-Elliptic Transfers and Refueling / Agni Bandyopadhyay, Gunther Waxenegger-Wilfing
日本語で読む → - 論文自動運転/強化学習ロボティクス
ハミルトン・ヤコビ到達可能性と強化学習による自転車との安全なインタラクション
自動運転車が自転車と安全かつ効率的に相互作用するため、ハミルトン・ヤコビ到達可能性解析と深層Q学習を組み合わせ、安全性を考慮した報酬設計と自転車の反応モデルを導入したフレームワークを提案。
原題: Interacting safely with cyclists using Hamilton-Jacobi reachability and reinforcement learning / Aarati Andrea Noronha, Jean Oh
日本語で読む → - 論文階層型強化学習機械学習
エンティティ中心の階層型強化学習と因子分解サブゴール拡散
複数エンティティ環境での長期目標タスクに対し、価値ベースのGCRLエージェントと因子分解サブゴール生成拡散モデルを組み合わせた階層型オフライン強化学習手法を提案し、疎報酬の画像ベース長期タスクで成功率を大幅に向上させた。
原題: Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion / Dan Haramati, Carl Qi, Tal Daniel 他
日本語で読む → - 論文強化学習機械学習
MePoly: 最大エントロピー多項式方策最適化
多項式エネルギーベースモデルで方策を表現し、明示的な確率密度と厳密なエントロピー最大化を可能にした新しい強化学習・模倣学習手法を提案。
原題: MePoly: Max Entropy Polynomial Policy Optimization / Hang Liu, Sangli Teng, Maani Ghaffari
日本語で読む → - 論文医療ロボティクス/強化学習ロボティクス
階層型モジュラー・マルチエージェント強化学習による機械的血栓回収術のAI自律ナビゲーション
大腿動脈から内頸動脈までのカテーテルとガイドワイヤの二デバイス操作を、階層型モジュラー・マルチエージェント強化学習で自律化し、in silicoおよびin vitroで有効性を実証した研究。
原題: Toward AI Autonomous Navigation for Mechanical Thrombectomy using Hierarchical Modular Multi-agent Reinforcement Learning (HM-MARL) / Harry Robertshaw, Nikola Fischer, Lennart Karstensen 他
日本語で読む → - 論文安全強化学習機械学習
摂動下で頑健なニューラルLyapunov障壁証明書の形式的合成
システムダイナミクスの有界な摂動に対して安全性・安定性の保証を維持する頑健なニューラルLyapunov障壁証明書を、敵対的訓練とLipschitz正則化で学習する手法を提案し、倒立振子と2Dドッキングで有効性を示した。
原題: Formal Synthesis of Certifiably Robust Neural Lyapunov-Barrier Certificates / Chengxiao Wang, Haoze Wu, Gagandeep Singh
日本語で読む → - 論文軌道ロボティクス/強化学習AI
強化学習による多数デブリランデブー計画の最適化:燃料補給と適応的衝突回避の統合
小型衛星による複数デブリ除去のため、燃料補給と適応的衝突回避を組み込んだマスク付きPPO強化学習でランデブー順序と軌道を最適化する枠組みを提案した。
原題: Optimizing Mission Planning for Multi-Debris Rendezvous Using Reinforcement Learning with Refueling and Adaptive Collision Avoidance / Agni Bandyopadhyay, Gunther Waxenegger-Wilfing
日本語で読む → - 論文自動運転/強化学習ロボティクス
ベクトル意味表現と記号推論による人間中心の自動緊急ブレーキのための強化学習強化
自動運転の緊急ブレーキにおいて、意味・空間・形状情報を統合したニューロシンボリック特徴表現と、ソフト一階論理による報酬関数を提案し、安全性と政策の堅牢性を向上させた。
原題: Reinforcement Learning Enhancement Using Vector Semantic Representation and Symbolic Reasoning for Human-Centered Autonomous Emergency Braking / Vinal Asodia, Iman Sharifi, Saber Fallah
日本語で読む → - 論文強化学習/ドローン制御ロボティクス
幾何学的対称性を活用したドローンのアクロバット飛行のマルチタスク強化学習
ドローンのアクロバット飛行をマルチタスクで学習するため、機体の回転対称性をポリシーネットワークに組み込んだ強化学習フレームワークGEARを提案し、高い成功率と実機での複雑な機動を実現した。
原題: Multi-Task Reinforcement Learning of Drone Aerobatics by Exploiting Geometric Symmetries / Zhanyu Guo, Zikang Yin, Guobin Zhu 他
日本語で読む → - 論文オフライン強化学習機械学習
局所ダイナミクス適応によるオフダイナミクスオフライン強化学習
ソースとターゲットの遷移をクラスタリングし、クラスタ単位でダイナミクス不一致を評価してソースデータを選択する手法を提案し、オフダイナミクスオフラインRLの性能を向上させた。
原題: Localized Dynamics-Aware Domain Adaption for Off-Dynamics Offline Reinforcement Learning / Zhangjie Xia, Yu Yang, Pan Xu
日本語で読む → - 論文強化学習機械学習
空間平滑化による価値学習
オフライン目標条件付き強化学習において、距離的制約を局所空間測度の期待値として再解釈し、微分演算子を必要とせずに構造化された価値表現を学習する手法を提案。
原題: Mollified Value Learning / Hrishikesh Viswanath, Juanwu Lu, S. Talha Bukhari 他
日本語で読む → - 論文オフライン強化学習機械学習
不確実性を考慮したランク1 MIMO Qネットワークによる高速オフライン強化学習フレームワーク
オフライン強化学習における分布外データの活用と計算効率の両立を目指し、データの不確実性を定量化してQ関数の下限信頼境界を最大化するランク1 MIMO Qネットワークを提案した。
原題: Uncertainty-Aware Rank-One MIMO Q Network Framework for Accelerated Offline Reinforcement Learning / Thanh Nguyen, Tung Luu, Tri Ton 他
日本語で読む → - 論文強化学習/故障復旧機械学習
小脳に着想を得た残差制御による故障復旧:推論時適応から構造的定着まで
凍結した強化学習方策に小脳模倣のオンライン残差補正を加え、再学習なしで故障復旧を実現する枠組みを提案し、MuJoCoで最大66%の性能改善を示した。
原題: Cerebellar-Inspired Residual Control for Fault Recovery: From Inference-Time Adaptation to Structural Consolidation / Nethmi Jayasinghe, Diana Gontero, Spencer T. Brown 他
日本語で読む → - 論文マルチエージェント強化学習/自動運転ロボティクス
TSC: 相互作用運転のためのトポロジー条件付きシュタッケルベルク型マルチエージェント強化学習
軌跡の編み込み関係から動的な優先度グラフを抽出し、局所的なリーダー・フォロワー関係に基づくシュタッケルベルク型協調方策をCTDEで学習する、通信不要の分散型自動運転フレームワークを提案。
原題: TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving / Xiaotong Zhang, Gang Xiong, Yuanjing Wang 他
日本語で読む → - 論文強化学習/ドローンレースロボティクス
ランダム障害物を伴うクアッドロータレースのためのカリキュラム強化学習
視覚ベースのカリキュラム強化学習で、障害物のあるドローンレースにおいて高速かつ堅牢に飛行する制御器を訓練した研究。
原題: Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles / Fangyu Sun, Fanxing Li, Yu Hu 他
日本語で読む → - 論文医療ロボティクス/強化学習ロボティクス
オンライン専門家補正を用いたサンプル効率の良い血管分岐ナビゲーションのための自律カテーテル操作
血管内分岐ナビゲーションにおいて、オンライン専門家補正とファジィ制御・構造化報酬を組み合わせた強化学習フレームワークを提案し、少ない訓練エピソードで高精度な自律カテーテル操作を実現した。
原題: Sample-Efficient Learning with Online Expert Correction for Autonomous Catheter Steering in Endovascular Bifurcation Navigation / Hao Wang, Tianliang Yao, Bo Lu 他
日本語で読む → - 論文強化学習ロボティクス
マルチモーダルエージェントによるロボット強化学習の加速
人間の代わりにマルチモーダルエージェントが修正ウェイポイントや空間制約を与え、ロボットの強化学習を効率化するAGPSを提案。
原題: Accelerating Robotic Reinforcement Learning with Agent Guidance / Haojun Chen, Zili Zou, Chengdong Ma 他
日本語で読む → - 論文歩行/リハビリ/強化学習ロボティクス
片側筋力低下による歩行非対称性と足関節アシストによる改善:強化学習に基づくシミュレーション研究
強化学習と筋骨格シミュレーションを用いて、片脚の筋力低下が歩行の非対称性をどの程度引き起こすかを定量化し、足関節外骨格によるアシストが非対称性を改善できるかを検証した。
原題: Gait Asymmetry from Unilateral Weakness and Improvement With Ankle Assistance: a Reinforcement Learning based Simulation Study / Yifei Yuan, Ghaith Androwis, Xianlian Zhou
日本語で読む → - 論文強化学習×軌道最適化ロボティクス
CACTO-BIC: バイアス付きサンプリングとGPU加速軌道最適化によるスケーラブルなアクター・クリティック学習
軌道最適化と強化学習を組み合わせたCACTOを改良し、価値関数に基づく初期状態サンプリングのバイアスとGPU加速により、サンプル効率と計算速度を向上させた。四足ロボットAlienGOでリアルタイム応用可能なスケーラビリティを示した。
原題: CACTO-BIC: Scalable Actor-Critic Learning via Biased Sampling and GPU-Accelerated Trajectory Optimization / Elisa Alboni, Pietro Noah Crestaz, Elias Fontanari 他
日本語で読む → - 論文外骨格/強化学習ロボティクス
強化学習によるモジュラー股関節・膝関節外骨格のスクワット支援
物理シミュレーションで強化学習したニューラルネット制御器を股関節・膝関節外骨格に適用し、スクワット時の代謝コストを約10%削減できることを示した。
原題: Reinforcement-Learning-Based Assistance Reduces Squat Effort with a Modular Hip--Knee Exoskeleton / Neethan Ratnakumar, Mariya Huzaifa Tohfafarosh, Saanya Jauhri 他
日本語で読む → - 論文強化学習/制御ロボティクス
アクションジャコビアンペナルティで滑らかな時変線形方策を学習
アクションの時間変化を自動微分で罰則化するアクションジャコビアンペナルティと、計算負荷を抑える線形方策ネットワークを提案し、滑らかな制御信号を生成する方策を学習する。
原題: Learning Smooth Time-Varying Linear Policies with an Action Jacobian Penalty / Zhaoming Xie, Kevin Karol, Jessica Hodgins
日本語で読む → - 論文階層強化学習AI
後知恵経験再生によるスパース報酬下でのオプション学習の実現
スパース報酬の多目標環境で階層強化学習のオプション学習を可能にするため、後知恵経験再生(HER)を統合し、さらに物体操作向けに二重目標HER(2HER)を提案した論文。
原題: Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay / Gabriel Romio, Mateus Begnini Melchiades, Bruno Castro da Silva 他
日本語で読む →