論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習/システムアーキテクチャロボティクス
UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
原題: UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms / Yufei Jia, Zhanxiang Cao, Mingrui Yu 他
日本語で読む → - 論文VLA/強化学習/巧緻操作ロボティクス
BORA: オフライン強化学習とオンライン残差適応を橋渡しする実世界巧緻操作VLAモデル
実世界の巧緻操作向けに、オフライン学習で価値関数を構築し、オンラインで人間介入による残差適応を行うVLAモデルの後訓練フレームワークを提案した。
原題: BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models / Zhongxi Chen, Yifan Han, Yanming Shao 他
日本語で読む → - 論文強化学習機械学習
分位点結合フローマッチングによる分布強化学習
分布強化学習における条件付きフローマッチング批判器の損失がワッサーシュタイン距離と整合しない問題を解決するため、ソースとベルマン目標サンプルを分位点で整列させるFlowIQNを提案した。
原題: Quantile-Coupled Flow Matching for Distributional Reinforcement Learning / Michael Groom, Victor-Alexandru Darvariu, Lars Kunze 他
日本語で読む → - 論文触覚/強化学習/sim2realロボティクス
触覚スキンを用いた2本指間での小物体の制御分離の学習
多目的ロボットハンドの2本指で小物体を掴み、触覚のみを用いて所望の個数だけ指間に残す制御分離タスクを提案・解決した。強化学習をシミュレーションで訓練し、実機への転送も成功させた。
原題: Learning Controlled Separation of Small Objects Between Two Fingers with a Tactile Skin / Ulf Kasolowsky, Berthold Bäuml
日本語で読む → - 論文強化学習/VLAロボティクス
配備しながら学習:汎用ロボットポリシーのためのフリート規模強化学習
事前学習済みのVLAポリシーを、ロボットフリートからの実データで継続的に強化学習し、配備中に性能を向上させるフレームワークを提案。16台の二腕ロボットで95%の成功率を達成。
原題: Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies / Yi Wang, Xinchen Li, Pengwei Xie 他
日本語で読む → - 論文宇宙機マニピュレーション/強化学習ロボティクス
事前方針誘導による宇宙機-マニピュレータシステムのデュアルエージェント協調操作計画
宇宙機とマニピュレータの動的干渉を考慮し、エンドエフェクタの高精度到達とベース姿勢安定化を同時に実現するデュアルエージェント協調計画フレームワークを提案した。事前方針誘導型深層強化学習とタイムステップレベル専門家切替機構を導入し、学習効率と成功率を向上させた。
原題: Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System / Yuhui Hu, Dong Zhou, Kaihong Ouyang 他
日本語で読む → - 論文強化学習/スタント制御ロボティクス
LineRides: ライン誘導型強化学習による自転車ロボットのスタント動作獲得
ユーザーが指定した空間的なガイドラインと疎なキー姿勢のみから、デモなしで自転車ロボットに多様なスタント動作を学習させるフレームワークを提案した。
原題: LineRides: Line-Guided Reinforcement Learning for Bicycle Robot Stunts / Seungeun Rho, Shamel Fahmi, Jeonghwan Kim 他
日本語で読む → - 論文強化学習/転移学習ロボティクス
カスタムカーレース環境のための転移学習
深層強化学習において、あるサーキットで訓練したエージェントを別のカスタム環境に転移させ、ゼロショット転移や微調整で速いラップタイムを達成する手法を探求した。モデルベース手法がモデルフリー手法より性能と収束速度で優れることを示した。
原題: Transfer Learning for Customized Car Racing Environments / Benedict Florance Arockiaraj, Richard Chang, Wesley Yee
日本語で読む → - 論文強化学習/視覚ロボティクス
確率的分離ポリシー勾配による効率的なオンポリシー視覚強化学習
軌道ロールアウトのランダム摂動でポリシー勾配を推定し、単一GPUで数時間の学習を実現する軽量な視覚強化学習手法SDPGを提案。視覚MuJoCoベンチマークで既存手法より高速・低メモリ・高報酬を達成し、実機へのsim-to-real転送も実証した。
原題: Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient / Haoxiang You, Yilang Liu, Davis Zong 他
日本語で読む → - 論文多目的強化学習ロボティクス
多目的方策最適化のための適応的スムーズ・チェビシェフ注意機構
ロボットの多目的強化学習において、非凸なパレート最適解を安定して発見するため、勾配干渉に応じて最適化の滑らかさを動的に調整する適応的スムーズ・チェビシェフ枠組みを提案した。
原題: Adaptive Smooth Tchebycheff Attention for Multi-Objective Policy Optimization / Alejandro Murillo-Gonzalez, Mahmoud Ali, Lantao Liu
日本語で読む → - 論文強化学習機械学習
信頼領域Q-随伴マッチング
事前学習済みフローポリシーのオフポリシー強化学習を安定化するため、経路空間KLを信頼領域パラメータで制御するTRQAMを提案し、50のOGBenchタスクで既存手法を上回る性能を達成した。
原題: Trust Region Q Adjoint Matching / Yonghoon Dong, Kyungmin Lee, Changyeon Kim 他
日本語で読む → - 論文強化学習ロボティクス
批判者ガイダンスによるサンプル効率的な拡散ベース強化学習
拡散ポリシーを用いた強化学習において、探索と活用のバランスを改善するため、訓練不要のガイダンス技術を拡散過程に統合し、批判者ネットワークが高価値と判断する領域へ行動生成を誘導する手法CGPOを提案した。MuJoCoの5つのタスクで最先端の性能を達成した。
原題: Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance / Shutong Ding, Zejia Zhong, Zhongyi Wang 他
日本語で読む → - 論文強化学習/飛行制御ロボティクス
重心再構成による劣駆動飛行船の二段階強化学習制御
推力2基と可動スライダーを持つ劣駆動飛行船の追従制御を、重心計画と推力制御を分離した二段階強化学習で実現し、シミュレーションと実機実験で有効性を示した論文。
原題: Bi-Level Reinforcement Learning Control for an Underactuated Blimp via Center-of-Mass Reconfiguration / Xiaorui Wang, Hongwu Wang, Yue Fan 他
日本語で読む → - 論文強化学習/歩行ロボティクス
外部力誘導カリキュラム学習による動的運動の学習
スポッティングに着想を得た外部補助力を訓練中に導入し、報酬設計や参照軌道なしで動的全身体運動の学習を加速・可能にする手法を提案した。
原題: EFGCL: Learning Dynamic Motion through Spotting-Inspired External Force Guided Curriculum Learning / Keita Yoneda, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文逆強化学習機械学習
信頼領域逆強化学習:局所方策更新を用いた明示的双対上昇法
逆強化学習において、毎回RL問題を完全に解くことなく、信頼領域制約付きの局所更新で双対目的を明示的に最適化する手法を提案し、安定性と単調改善を両立した。
原題: Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates / Anish Diwan, Davide Tateo, Christopher E. Mower 他
日本語で読む → - 論文強化学習/操作ロボティクス
ハイブリッド接触ダイナミクス下での物理情報を活用した目標条件付き強化学習
接触を伴う操作タスクで物理情報を活用した目標条件付き強化学習(Pi-GCRL)が劣化する問題を分析し、接触を考慮した階層的定式化を提案して性能を改善した。
原題: Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics / Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi
日本語で読む → - 論文強化学習/ロコモーションロボティクス
ARC-RL: ARC Raidersに着想を得た強化学習プレイグラウンド
ゲームNPC向けの多様なロボット形態(ヘキサポッドや四足など)を備えたMuJoCo連続制御環境スイートを構築し、統一報酬関数とCPGデモを提供して、オンラインおよびオフラインからオンラインへの強化学習アルゴリズムを比較評価した。
原題: ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders / Carlo Romeo, Andrew D. Bagdanov
日本語で読む → - 論文強化学習ロボティクス
階層的マクロ行動量子化による強化学習エージェントの人間らしさ向上
人間のデモンストレーションを階層的なベクトル量子化でマクロ行動に符号化し、報酬を最大化しつつ人間らしい行動系列を予測する強化学習フレームワークHiMAQを提案した。
原題: Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization / Usman Nizamani, M. Shaheer Luqman, Fawad Javed Fateh 他
日本語で読む → - 論文ワールドモデル/強化学習機械学習
PH-Dreamer: ポート・ハミルトン生成ダイナミクスによる物理駆動ワールドモデル
リカレント状態空間モデルにポート・ハミルトン構造を導入し、物理法則に従う潜在ダイナミクスを学習するワールドモデルを提案。エネルギー勾配を用いたActor-Criticで制御を最適化し、報酬予測精度とエネルギー効率を向上させた。
原題: PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics / Xueyu Luan, Chenwei Shi
日本語で読む → - 論文ドローン/強化学習ロボティクス
強化学習による視覚誘導の屋外飛行と障害物回避
ステレオ深度と視覚慣性オドメトリを用いて、未知環境で障害物を回避しながら目標点へ自律飛行するセンサモータポリシーを提案。シミュレーションで訓練し、実機へゼロショット転送に成功した。
原題: Vision-Guided Outdoor Flight and Obstacle Evasion via Reinforcement Learning / Shiladitya Dutta, Aayush Gupta, Varun Saran 他
日本語で読む → - 論文強化学習機械学習
人間フィードバックを活用した意味的に有用なスキル発見
強化学習における教師なしスキル発見に人間のフィードバックを組み込み、意味的に多様で関連性のあるスキルを効率的に発見する手法を提案した。
原題: Leveraging Human Feedback for Semantically-Relevant Skill Discovery / Maxence Hussonnois, Thommen George Karimpanal, Santu Rana
日本語で読む → - 論文強化学習機械学習
有界比率強化学習
PPOのヒューリスティックなクリップ目的と信頼領域法の理論的ギャップを埋めるため、有界比率強化学習(BRRL)フレームワークを提案し、解析的最適解と単調性能改善を保証する新しいポリシー最適化アルゴリズムBPOを開発した。
原題: Bounded Ratio Reinforcement Learning / Yunke Ao, Le Chen, Bruce D. Lee 他
日本語で読む → - 論文強化学習機械学習
拡張ベスト・オブ・Nサンプリングによる推論時の柔軟なエンパワーメント
強化学習において、エンパワーメントを報酬ボーナスとして与える代わりに、ベスト・オブ・Nサンプリングを適用し、探索と活用のバランスを柔軟に調整する手法を提案した。
原題: Flexible Empowerment at Reasoning with Extended Best-of-N Sampling / Taisuke Kobayashi
日本語で読む → - 論文強化学習AI
モデルベース強化学習のためのアドバンテージ誘導拡散
拡散世界モデルを用いたモデルベース強化学習において、報酬ではなくアドバンテージ推定で逆拡散過程を誘導し、長期的なリターンが高い軌道を生成する手法を提案した。
原題: Advantage-Guided Diffusion for Model-Based Reinforcement Learning / Daniele Foffano, Arvid Eriksson, David Broman 他
日本語で読む → - 論文強化学習機械学習
GIRL: 情報理論的幻覚制御による生成的想像強化学習
モデルベース強化学習において、想像上のロールアウトのドリフトを防ぐため、凍結された基盤モデルからのクロスモーダルな接地信号と不確実性適応型の信頼領域ボトルネックを導入した新しい潜在世界モデルフレームワークを提案した。
原題: GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control / Prakul Sunil Hiremath
日本語で読む → - 論文強化学習機械学習
非定常性で失われるランクと勾配:強化学習における可塑性損失を緩和するサンプル重み減衰
強化学習の可塑性損失をネットワーク最適化の理論的観点から分析し、勾配減衰を補正する軽量な手法「サンプル重み減衰」を提案した。
原題: The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning / Zihao Wu, Hongyao Tang, Yi Ma 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
物理情報強化学習による空間密度速度ポテンシャルを用いたマップ不要レーシング
事前マップなしの自動運転レーシングにおいて、深度測定のスペクトル分布から非線形車両ダイナミクスをパラメータ化し、物理情報に基づく報酬でDRLエージェントを訓練する手法を提案。シミュレーションから実機への転移を改善し、人間のデモより12%高い性能を達成。
原題: Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing / Shathushan Sivashangaran, Apoorva Khairnar, Sepideh Gohari 他
日本語で読む → - 論文探査/強化学習ロボティクス
ロボット探査アルゴリズムにおける動的グラフの学習ベース間引き
ロボット探査で用いる動的グラフを強化学習(PPO)で間引き、冗長な情報を削減する手法を提案。RRTによるフロンティア探査のシミュレーションでグラフサイズを最大96%削減し、探索の一貫性が向上することを示した。
原題: Learning-Based Sparsification of Dynamic Graphs in Robotic Exploration Algorithms / Adithya V. Sastry, Bibek Poudel, Weizi Li
日本語で読む → - 論文自動運転/強化学習ロボティクス
レーシングパラメータ化深層強化学習による自動運転車の衝突回避
自動運転車の衝突回避に、レースカーの追い越しを模したパラメータ化深層強化学習を適用し、シミュレーションで学習したポリシーを実機に転移して、従来のMPC-APFより優れた性能と低計算コストを実証した。
原題: Autonomous Vehicle Collision Avoidance With Racing Parameterized Deep Reinforcement Learning / Shathushan Sivashangaran, Vihaan Dutta, Apoorva Khairnar 他
日本語で読む → - 論文強化学習/フローマッチングロボティクス
ScoRe-Flow: スコアベース強化学習によるフローマッチングの完全な分布制御
フローマッチングポリシーを強化学習で微調整する際、スコア関数によるドリフト変調と学習可能な分散予測を組み合わせ、遷移の平均と分散を分離制御する手法を提案。D4RLや操作タスクで高速収束と成功率向上を実証。
原題: ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching / Xiaotian Qiu, Lukai Chen, Jinhao Li 他
日本語で読む →