論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習/形態制御協調設計機械学習
スタッケルベルグ近位方策最適化による効率的な形態・制御協調設計
ロボットの形態と制御方策を同時に最適化する問題をスタッケルベルグゲームとして定式化し、制御の適応ダイナミクスを明示的に組み込んだ新しいアルゴリズムを提案した。
原題: Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization / Yanning Dai, Yuhui Wang, Dylan R. Ashley 他
日本語で読む → - 論文強化学習/自動運転ロボティクス
減衰残差方策最適化による実世界自動運転レースの効率化
残差方策学習を拡張し、ベース方策を徐々に減衰させて単独のニューラル方策を得る手法を提案し、1/10スケールの自動運転レースでシミュレーションと実機の両方で性能を向上させた。
原題: Efficient Real-World Autonomous Racing via Attenuated Residual Policy Optimization / Raphael Trumpp, Denis Hoornaert, Mirco Theile 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
強化学習と対戦車両の姿勢推定を用いた自動追い越し軌道最適化
LiDARと深度カメラのセンサ融合と強化学習により、自動運転レースでの追い越し軌道を最適化する手法を提案し、シミュレーションと実機で有効性を確認した。
原題: Autonomous overtaking trajectory optimization using reinforcement learning and opponent pose estimation / Matej Rene Cihlar, Luka Šiktar, Branimir Ćaran 他
日本語で読む → - 論文強化学習ロボティクス
MO-Playground: ロボティクスのための大規模並列多目的強化学習
GPU上で高速に動作する多目的強化学習アルゴリズムと環境群を開発し、従来比25〜270倍の高速化でパレート最適方策を学習可能にした。
原題: MO-Playground: Massively Parallelized Multi-Objective Reinforcement Learning for Robotics / Neil Janwani, Ellen Novoseller, Vernon J. Lawhern 他
日本語で読む → - 論文強化学習機械学習
オンライン強化学習制御アルゴリズム解釈のためのCritic適合損失景観の可視化
オンライン強化学習のCriticネットワークの学習過程を低次元部分空間に射影して損失景観を可視化し、定量的指標で性能を比較する手法を提案。
原題: Visualizing Critic Match Loss Landscapes for Interpretation of Online Reinforcement Learning Control Algorithms / Jingyi Liu, Jian Guo, Eberhard Gill
日本語で読む → - 論文強化学習・計画ロボティクス
強化学習と動的計画法に基づく計画の関係
強化学習と計画の違いを整理し、非確率化した強化学習と価値反復法やダイクストラ法を比較して、コスト最小化と報酬最大化の等価条件などを解析した。
原題: Relating Reinforcement Learning to Dynamic Programming-Based Planning / Filip V. Georgiev, Kalle G. Timperi, Başak Sakçak 他
日本語で読む → - 論文自動運転/強化学習機械学習
ランジェバン誘導フローマッチングによる自動運転向けリアルタイム生成ポリシー
フローマッチングをオンライン強化学習に導入し、ランジェバンダイナミクスで経験を動的に最適化することで、1回の推論で高品質な行動を生成する低遅延な自動運転ポリシーを実現した。
原題: Real-Time Generative Policy via Langevin-Guided Flow Matching for Autonomous Driving / Tianze Zhu, Yinuo Wang, Wenjun Zou 他
日本語で読む → - 論文VLA/強化学習ロボティクス
π-StepNFT: フローベースVLAのオンライン強化学習における広い空間には細かいステップが必要
フローベースの視覚言語行動モデルに対する新しい強化学習フレームワークを提案し、尤度計算や価値ネットワークを不要にして、単一の順伝播でステップごとのガイダンスを提供する。
原題: $\pi$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs / Siting Wang, Xiaofeng Wang, Zheng Zhu 他
日本語で読む → - 論文強化学習/制御ロボティクス
VisFly-Lab: クアッドローター制御の一階強化学習のための統合微分可能フレームワーク
クアッドローター制御のための統合微分可能フレームワークを提案し、ホバリング、追跡、着陸、レースの4タスクで一階強化学習を評価。標準的な一階学習の課題を解決するABPTアルゴリズムを導入し、実機への転移可能性も示した。
原題: VisFly-Lab: Unified Differentiable Framework for First-Order Reinforcement Learning of Quadrotor Control / Fanxing Li, Fangyu Sun, Tianbao Zhang 他
日本語で読む → - 論文強化学習/自律走行ロボティクス
専門知識駆動型強化学習による自律レーシング:軌道誘導と動的制約の活用
最小曲率レーシングラインによる軌道誘導と車両動的制約を強化学習に組み込み、二段階カリキュラム学習で安定走行から高速走行へと段階的に学習する自律レーシング手法を提案した。
原題: Expert Knowledge-driven Reinforcement Learning for Autonomous Racing via Trajectory Guidance and Dynamics Constraints / Bo Leng, Weiqi Zhang, Zhuoren Li 他
日本語で読む → - 論文強化学習/操作ロボティクス
D-SPEAR: ロボット操作における安定強化学習のための二重ストリーム優先経験適応リプレイ
アクターとクリティカルのサンプリングを分離し、適応アンカー機構で優先度付きリプレイと一様リプレイを切り替えることで、ロボット操作タスクでの強化学習の安定性と性能を向上させる手法を提案した。
原題: D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation / Yu Zhang, Karl Mason
日本語で読む → - 論文オフライン強化学習ロボティクス
一段階フローポリシーによる潜在方針の操縦
オフライン強化学習において、元の行動空間のQ勾配を微分可能な一段階MeanFlowポリシーを通じて逆伝播させ、潜在行動空間のアクターを更新する新しい手法LPSを提案。代理の潜在批評家を排除し、行動制約付き生成事前分布として機能させることで、最小限のチューニングで高い性能を達成した。
原題: Latent Policy Steering through One-Step Flow Policies / Hokyun Im, Andrey Kolobov, Jianlong Fu 他
日本語で読む → - 論文安全強化学習機械学習
制約付き楽観的探索を用いたオフポリシー安全強化学習
安全制約を満たすオフポリシー強化学習アルゴリズムCOX-Qを提案し、コスト制約付き探索と分布価値学習により、サンプル効率と安全性を両立させた。
原題: Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration / Guopeng Li, Matthijs T. J. Spaan, Julian F. P. Kooij
日本語で読む → - 論文安全強化学習機械学習
LTL制約をPPOに統合した安全な強化学習
線形時相論理(LTL)で記述された安全制約をPPOに統合し、制約違反を監視してペナルティ信号に変換することで、安全な強化学習を実現するフレームワークを提案した。
原題: Integrating LTL Constraints into PPO for Safe Reinforcement Learning / Maifang Zhang, Hang Yu, Qian Zuo 他
日本語で読む → - 論文強化学習ロボティクス
NFPO: 正規化フローによるロボットポリシー学習の安定化ポリシー最適化
ロボットの強化学習で、多峰性分布を表現できる正規化フローをポリシーとして用いる際の訓練不安定性を分析し、簡単な手法で安定化させて性能を向上させた。
原題: NFPO: Stabilized Policy Optimization of Normalizing Flow for Robotic Policy Learning / Diyuan Shi, Yiqi Tang, Zifeng Zhuang 他
日本語で読む → - 論文階層的強化学習ロボティクス
HierKick: 視覚誘導サッカーロボット制御のための階層的強化学習
サッカーロボット制御のための二周波数階層型強化学習フレームワークを提案し、高レベル方策で戦術選択、低レベル制御で精密な関節動作を実現。シミュレーションと実機で高い成功率を達成した。
原題: HierKick: Hierarchical Reinforcement Learning for Vision-Guided Soccer Robot Control / Yizhi Chen, Zheng Zhang, Zhanxiang Cao 他
日本語で読む → - 論文VLA/自動運転/強化学習画像認識
狭い方策に潜む悪魔:運転VLAモデルの探索を解き放つ
自動運転の模倣学習が探索を狭め、強化学習の性能を制限する問題を特定し、軌道拡張と多様性重視の報酬設計で解決するCurious-VLAを提案した。
原題: Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models / Canyu Chen, Yuguang Yang, Zhewen Tan 他
日本語で読む → - 論文強化学習ロボティクス
失敗から学ぶ:エピソディックメモリを用いた効率的な強化学習制御
強化学習の初期訓練で頻発する衝突や転倒などの失敗経験をエピソディックメモリに保存し、類似失敗を回避して長期的な軌道を探索する手法FEMAを提案。モデルフリーRLに容易に組み込め、MuJoCoタスクでサンプル効率を33.11%向上させ、実ロボットの二足歩行タスクでも有効性を確認した。
原題: Learning From Failures: Efficient Reinforcement Learning Control with Episodic Memory / Chenyang Miao
日本語で読む → - 論文空中把持/強化学習ロボティクス
Swooper: シンプルなグリッパーによる高速空中把持の学習
深層強化学習を用いて、高速飛行と能動的なグリッパー制御を単一のニューラルネットワークポリシーで統合し、ゼロショットで実機に展開して高い把持成功率を達成した。
原題: Swooper: Learning High-Speed Aerial Grasping With a Simple Gripper / Ziken Huang, Xinze Niu, Bowen Chai 他
日本語で読む → - 論文SLAM/強化学習ロボティクス
能動的SLAMのための大規模並列深層強化学習
能動的SLAMのためのスケーラブルなエンドツーエンド深層強化学習フレームワークを提案し、大規模並列トレーニングを可能にしてトレーニング時間を短縮し、連続行動空間をサポートする。
原題: Massive Parallel Deep Reinforcement Learning for Active SLAM / Martín Arce Llobera, Julio A. Placed, Mariano De Paula 他
日本語で読む → - 論文強化学習ロボティクス
ResWM: 残差アクション世界モデルによる視覚強化学習
視覚強化学習において、絶対アクションではなく前ステップからの差分である残差アクションを制御変数とする世界モデルを提案し、制御の滑らかさと学習安定性を向上させた。
原題: ResWM: Residual-Action World Model for Visual RL / Jseen Zhang, Gabriel Adineera, Jinzhou Tan 他
日本語で読む → - 論文強化学習AI
タスクをスケールせよ:マルチタスクモデルベース強化学習によるヒューマノイド制御の習得
サンプル数ではなくタスク数を増やすことで、モデルベース強化学習がヒューマノイドの多様なスキルを効率的に学習できることを示した論文。
原題: Scaling Tasks, Not Samples: Mastering Humanoid Control through Multi-Task Model-Based Reinforcement Learning / Shaohuai Liu, Weirui Ye, Yilun Du 他
日本語で読む → - 論文強化学習/操作ロボティクス
事前学習から熟達へ:分布収縮型強化学習による効率的なスキル習得
事前学習済みの生成ロボットポリシーを、分布収縮型強化学習(DICE-RL)で微調整し、高成功率の行動を増幅して高性能な「プロ」ポリシーへと進化させる手法を提案。シミュレーションと実機で高次元ピクセル入力からの複雑な長期的操作スキルの習得を実証した。
原題: From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning / Zhanyi Sun, Shuran Song
日本語で読む → - 論文強化学習/動作模倣ロボティクス
反復動作模倣による自転車ロボットのフリップスタント
実現不可能な参照動作を反復的に模倣する手法(IMI)を提案し、自転車ロボット(UMV)で前転フリップを成功させた。
原題: Flip Stunts on Bicycle Robots using Iterative Motion Imitation / Jeonghwan Kim, Shamel Fahmi, Seungeun Rho 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
強化学習に基づく動的ルックアヘッド距離を用いた自動運転レース用ピュア・パースート
自動運転レースにおいて、古典的なピュア・パースート制御のルックアヘッド距離をPPO強化学習で動的に調整するハイブリッド制御手法を提案し、シミュレーションと実車で性能を検証した。
原題: Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing / Mohamed Elgouhary, Amr S. El-Wakeel
日本語で読む → - 論文強化学習ロボティクス
Rainbow-DemoRL: デモンストレーション強化強化学習の改良を組み合わせる
オフラインデータを活用したオンライン強化学習のサンプル効率向上手法を3分類し、各手法の組み合わせ効果を実証的に分析した論文。
原題: Rainbow-DemoRL: Combining Improvements in Demonstration-Augmented Reinforcement Learning / Dwait Bhatt, Shih-Chieh Chou, Nikolay Atanasov
日本語で読む → - 論文強化学習機械学習
強化学習の解釈のための損失ランドスケープ可視化フレームワーク:ADHDPケーススタディ
強化学習の学習過程を可視化するフレームワークを提案し、ADHDPアルゴリズムを宇宙機の姿勢制御に適用して、損失曲面や状態TDマップなど4つの視点から学習ダイナミクスを解釈する。
原題: A Loss Landscape Visualization Framework for Interpreting Reinforcement Learning: An ADHDP Case Study / Jingyi Liu, Jian Guo, Eberhard Gill
日本語で読む → - 論文強化学習機械学習
SPAARS: 抽象探索と行動空間の洗練された活用による安全なRLポリシー整合
オフラインからオンラインへの強化学習において、潜在空間での安全な探索から生の行動空間での活用へと移行するカリキュラム学習フレームワークを提案し、デコーダの再構成損失による性能上限を克服する。
原題: SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space / Swaminathan S K, Aritra Hazra
日本語で読む → - 論文強化学習/ハイブリッド移動ロボティクス
階段状地形におけるハイブリッドロボットの省エネルギー空陸駆動学習
空中と地上の両方を移動できるハイブリッドロボットに対し、エネルギー消費を考慮した強化学習でプロペラ・車輪・チルトサーボを協調制御する単一ポリシーを学習し、シミュレーションと実機で省エネルギー効果を実証した論文。
原題: Learning Energy-Efficient Air--Ground Actuation for Hybrid Robots on Stair-Like Terrain / Jiaxing Li, Wen Tian, Xinhang Xu 他
日本語で読む → - 論文ドローンレース/強化学習ロボティクス
ベクトル場拡張によるビジョンベースドローンレースの微分可能ポリシー学習
ドローンレース向けに、微分可能な損失とベクトル場を組み合わせた新しい学習フレームワークDiffRacingを提案し、シミュレーションと実機で高いサンプル効率と堅牢な飛行性能を実証した。
原題: Vector Field Augmented Differentiable Policy Learning for Vision-Based Drone Racing / Yang Su, Feng Yu, Yu Hu 他
日本語で読む →