論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習ロボティクス
ViSA: 訪問状態拡張による汎用ゴール空間コントラスト強化学習
ゴール条件付き強化学習におけるコントラスト学習の価値関数推定が限られたゴールにしか正確でない問題を解決するため、訪問状態を拡張するデータ拡張手法ViSAを提案し、シミュレーションと実ロボットで汎化性能を向上させた。
原題: ViSA: Visited-State Augmentation for Generalized Goal-Space Contrastive Reinforcement Learning / Issa Nakamura, Tomoya Yamanokuchi, Yuki Kadokawa 他
日本語で読む → - 論文強化学習機械学習
大規模強化学習におけるアンサンブル方策勾配法のポリシー多様性の再考
アンサンブル方策勾配法において、ポリシー間の多様性をKL制約で調整するCoupled Policy Optimizationを提案し、探索効率と最終性能を向上させた。
原題: Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning / Naoki Shitanda, Motoki Omura, Tatsuya Harada 他
日本語で読む → - 論文強化学習ロボティクス
大規模報酬モデル:視覚言語モデルによる汎用的なオンラインロボット報酬生成
ロボット操作の強化学習において、視覚言語モデルをオンライン報酬生成器として活用し、模倣学習で初期化した方策を少数の反復で改善する枠組みを提案した。
原題: Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models / Yanru Wu, Weiduo Yuan, Ang Qi 他
日本語で読む → - 論文強化学習/自動運転ロボティクス
減衰残差方策最適化による実世界自動運転レースの効率化
残差方策学習を拡張し、ベース方策を徐々に減衰させて単独のニューラル方策を得る手法を提案し、1/10スケールの自動運転レースでシミュレーションと実機の両方で性能を向上させた。
原題: Efficient Real-World Autonomous Racing via Attenuated Residual Policy Optimization / Raphael Trumpp, Denis Hoornaert, Mirco Theile 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
COIN: 協調と相互作用を考慮した自動運転のためのマルチエージェント強化学習
本論文は、自動運転のためのマルチエージェント強化学習フレームワークCOINを提案し、個別目標と協調目標を同時に最適化する新しいアルゴリズムと、局所・大域の相互作用を捉える批判者アーキテクチャを導入して、密集交通での安全性と効率を向上させた。
原題: COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems / Yifeng Zhang, Jieming Chen, Tingguang Zhou 他
日本語で読む → - 論文強化学習/探索ロボティクス
どこで学ぶか:オンポリシーロボット強化学習のための解析的方針勾配による指向的探索
微分可能な力学モデルからの解析的方針勾配を用いて、タスク認識かつ物理に基づくガイダンスを注入し、高報酬領域への探索を促進する新しい指向的探索手法を提案した。
原題: Where-to-Learn: Analytical Policy Gradient Directed Exploration for On-Policy Robotic Reinforcement Learning / Leixin Chang, Xinchen Yao, Ben Liu 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
スカラー報酬を超えて:安全で信頼性の高い自動運転のための事前順序付き目的を持つ分布強化学習
複数の競合する目的(安全性、効率性、快適性)を扱うため、報酬成分に事前順序を導入したPr-MOMDPと、分布を単一統計量に縮約せず比較するQuantile Dominance指標を提案し、自動運転タスクで安全性と成功率を向上させた。
原題: Beyond Scalar Rewards: Distributional Reinforcement Learning with Preordered Objectives for Safe and Reliable Autonomous Driving / Ahmed Abouelazm, Jonas Michel, Daniel Bogdoll 他
日本語で読む → - 論文歩行/強化学習ロボティクス
SteadyTray: 残差強化学習による人型ロボットのトレイ運搬における物体バランス学習
人型ロボットが歩行中にトレイ上の物体を安定して運ぶための階層型強化学習フレームワークを提案し、歩行制御と物体安定化を分離することで高い成功率と実機でのゼロショット転移を実現した。
原題: SteadyTray: Learning Object Balancing Tasks in Humanoid Tray Transport via Residual Reinforcement Learning / Anlun Huang, Zhenyu Wu, Soofiyan Atar 他
日本語で読む → - 論文階層的強化学習ロボティクス
HierKick: 視覚誘導サッカーロボット制御のための階層的強化学習
サッカーロボット制御のための二周波数階層型強化学習フレームワークを提案し、高レベル方策で戦術選択、低レベル制御で精密な関節動作を実現。シミュレーションと実機で高い成功率を達成した。
原題: HierKick: Hierarchical Reinforcement Learning for Vision-Guided Soccer Robot Control / Yizhi Chen, Zheng Zhang, Zhanxiang Cao 他
日本語で読む → - 論文マルチエージェント強化学習画像認識
支援動作の学習:マルチエージェント強化学習による物理基盤の人間-人間制御
人間同士の支援動作(力のやり取りを伴う)を物理シミュレータ上でマルチエージェント強化学習により模倣する手法を提案し、支援者と被支援者の双方のポリシーを協調学習させることで、従来手法では困難だった支援動作の追跡を可能にした。
原題: Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning / Yuto Shibata, Kashu Yamazaki, Lalit Jayanti 他
日本語で読む → - 論文移動操作/強化学習/リスク認識ロボティクス
移動操作のためのリスク認識強化学習
移動マニピュレータのリスク認識行動を学習する手法を提案。分布強化学習でリスク中立な教師ポリシーを訓練し、歪みリスク指標でリスク調整した後、模倣学習で深度観測に基づく学生ポリシーに蒸留する。
原題: Risk-Aware Reinforcement Learning for Mobile Manipulation / Michael Groom, James Wilson, Nick Hawes 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
強化学習に基づく動的ルックアヘッド距離を用いた自動運転レース用ピュア・パースート
自動運転レースにおいて、古典的なピュア・パースート制御のルックアヘッド距離をPPO強化学習で動的に調整するハイブリッド制御手法を提案し、シミュレーションと実車で性能を検証した。
原題: Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing / Mohamed Elgouhary, Amr S. El-Wakeel
日本語で読む → - 論文強化学習AI
タスクをスケールせよ:マルチタスクモデルベース強化学習によるヒューマノイド制御の習得
サンプル数ではなくタスク数を増やすことで、モデルベース強化学習がヒューマノイドの多様なスキルを効率的に学習できることを示した論文。
原題: Scaling Tasks, Not Samples: Mastering Humanoid Control through Multi-Task Model-Based Reinforcement Learning / Shaohuai Liu, Weirui Ye, Yilun Du 他
日本語で読む → - 論文強化学習ロボティクス
失敗から学ぶ:エピソディックメモリを用いた効率的な強化学習制御
強化学習の初期訓練で頻発する衝突や転倒などの失敗経験をエピソディックメモリに保存し、類似失敗を回避して長期的な軌道を探索する手法FEMAを提案。モデルフリーRLに容易に組み込め、MuJoCoタスクでサンプル効率を33.11%向上させ、実ロボットの二足歩行タスクでも有効性を確認した。
原題: Learning From Failures: Efficient Reinforcement Learning Control with Episodic Memory / Chenyang Miao
日本語で読む → - 論文強化学習/操作ロボティクス
事前学習から熟達へ:分布収縮型強化学習による効率的なスキル習得
事前学習済みの生成ロボットポリシーを、分布収縮型強化学習(DICE-RL)で微調整し、高成功率の行動を増幅して高性能な「プロ」ポリシーへと進化させる手法を提案。シミュレーションと実機で高次元ピクセル入力からの複雑な長期的操作スキルの習得を実証した。
原題: From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning / Zhanyi Sun, Shuran Song
日本語で読む → - 論文VLA/強化学習ロボティクス
SmoothVLA: 内在的滑らかさ最適化による物理的制約へのVLAモデル整合
ロボット操作のためのVLAモデルに対し、軌道の滑らかさを内在報酬として組み込んだ強化学習フレームワークを提案し、タスク性能と物理的実現性を両立させた。
原題: SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization / Jiashun Li, Xiaoyu Shi, Hong Xie 他
日本語で読む → - 論文宇宙ロボット/経路計画/強化学習ロボティクス
軌道上自由飛行マルチアームロボットの経路計画と強化学習駆動制御
軌道上サービスにおける自由飛行マルチアームロボットの運動計画と制御に、軌道最適化と強化学習を組み合わせたハイブリッド手法を提案し、シミュレーションで有効性を検証した。
原題: Path Planning and Reinforcement Learning-Driven Control of On-Orbit Free-Flying Multi-Arm Robots / Álvaro Belmonte-Baeza, José Luis Ramón, Leonard Felicetti 他
日本語で読む → - 論文計画/強化学習ロボティクス
GraSP-STL: オフライン目標条件付き強化学習によるゼロショット信号時相論理計画のためのグラフベースフレームワーク
オフラインデータのみを用いて、未見のSTL仕様を満たす制御戦略をゼロショットで合成するグラフ探索ベースのフレームワークを提案した。
原題: GraSP-STL: A Graph-Based Framework for Zero-Shot Signal Temporal Logic Planning via Offline Goal-Conditioned Reinforcement Learning / Ancheng Hou, Ruijia Liu, Xiang Yin
日本語で読む → - 論文安全なオフライン強化学習機械学習
ハード制約を超えて:安全なオフライン強化学習のための予算条件付き到達可能性
累積コスト制約を扱う安全なオフライン強化学習の新しい手法を提案。安全条件付き到達可能性集合を定義し、不安定なmin/max最適化を避けつつ安全ポリシーを学習する。
原題: Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning / Janaka Chathuranga Brahmanage, Akshat Kumar
日本語で読む → - 論文オフライン強化学習ロボティクス
後続遷移の再重み付けによる保守的オフラインロボット方策学習
ロボットのオフライン事後学習で、各サンプルの行動後の結果に基づいて学習への影響度を再重み付けする手法PTRを提案。不均一なデータセットでの保守的な適応を改善する。
原題: Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting / Wanpeng Zhang, Hao Luo, Sipeng Zheng 他
日本語で読む → - 論文ドローンレース/強化学習ロボティクス
ベクトル場拡張によるビジョンベースドローンレースの微分可能ポリシー学習
ドローンレース向けに、微分可能な損失とベクトル場を組み合わせた新しい学習フレームワークDiffRacingを提案し、シミュレーションと実機で高いサンプル効率と堅牢な飛行性能を実証した。
原題: Vector Field Augmented Differentiable Policy Learning for Vision-Based Drone Racing / Yang Su, Feng Yu, Yu Hu 他
日本語で読む → - 論文モデルベース強化学習機械学習
R2-Dreamer: デコーダやデータ拡張なしの冗長性低減世界モデル
画像ベースのモデルベース強化学習において、デコーダを使わず、データ拡張にも頼らない自己教師ありの冗長性低減目的で表現崩壊を防ぐフレームワークR2-Dreamerを提案し、既存手法と同等以上の性能を達成しつつ学習を高速化した。
原題: R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation / Naoki Morihira, Amal Nahar, Kartik Bharadwaj 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
強化学習と対戦車両の姿勢推定を用いた自動追い越し軌道最適化
LiDARと深度カメラのセンサ融合と強化学習により、自動運転レースでの追い越し軌道を最適化する手法を提案し、シミュレーションと実機で有効性を確認した。
原題: Autonomous overtaking trajectory optimization using reinforcement learning and opponent pose estimation / Matej Rene Cihlar, Luka Šiktar, Branimir Ćaran 他
日本語で読む → - 論文強化学習ロボティクス
解析的力学正則化による物理情報を活用した方策最適化
ロボット制御の強化学習に、シミュレータから得られる微分可能なラグランジュ残差を正則化項として導入し、物理的に一貫した方策学習を効率化する手法PIPERを提案した。
原題: Physics-Informed Policy Optimization via Analytic Dynamics Regularization / Namai Chandra, Liu Mohan, Zhihao Gu 他
日本語で読む → - 論文筋骨格ロボット/強化学習ロボティクス
Diff-Muscle: 筋骨格ロボット卓球のための効率的学習
筋骨格ロボットの制御を、微分平坦性を用いて冗長な筋活性化空間から低次元の関節空間へ再定式化し、階層的強化学習により卓球ラリーを実現する手法を提案した。
原題: Diff-Muscle: Efficient Learning for Musculoskeletal Robotic Table Tennis / Wentao Zhao, Jun Guo, Kangyao Huang 他
日本語で読む → - 論文強化学習/モデル構造ロボティクス
関節剛体ダイナミクスネットワーク:ロボット学習のためのダイナミクス基盤事前知識
関節ロボットの運動学ではなく動力学構造をグラフニューラルネットワークに組み込んだABD-Netを提案し、シミュレーションと実機で学習効率とロバスト性を向上させた。
原題: Articulated-Body Dynamics Network: Dynamics-Grounded Prior for Robot Learning / Sangwoo Shin, Kunzhao Ren, Xiaobin Xiong 他
日本語で読む → - 論文空中把持/強化学習ロボティクス
Swooper: シンプルなグリッパーによる高速空中把持の学習
深層強化学習を用いて、高速飛行と能動的なグリッパー制御を単一のニューラルネットワークポリシーで統合し、ゼロショットで実機に展開して高い把持成功率を達成した。
原題: Swooper: Learning High-Speed Aerial Grasping With a Simple Gripper / Ziken Huang, Xinze Niu, Bowen Chai 他
日本語で読む → - 論文VLA/強化学習/蒸留ロボティクス
VLA-OPD: オフラインSFTとオンラインRLを架橋する、オンポリシー蒸留による視覚言語行動モデル
視覚言語行動モデルの事後学習において、オフラインSFTの分布ずれや破滅的忘却と、オンラインRLのスパース報酬や非効率性を解決するため、専門家教師による密なトークンレベル監督を学生の自己生成軌道に適用し、Reverse-KL目的で安定した学習を実現するフレームワークを提案した。
原題: VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation / Zhide Zhong, Haodong Yan, Junfeng Li 他
日本語で読む → - 論文SLAM/強化学習ロボティクス
能動的SLAMのための大規模並列深層強化学習
能動的SLAMのためのスケーラブルなエンドツーエンド深層強化学習フレームワークを提案し、大規模並列トレーニングを可能にしてトレーニング時間を短縮し、連続行動空間をサポートする。
原題: Massive Parallel Deep Reinforcement Learning for Active SLAM / Martín Arce Llobera, Julio A. Placed, Mariano De Paula 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
MA-VLCM: マルチエージェントチーム設定における方針価値推定のための視覚言語批評モデル
マルチエージェント強化学習において、学習済み視覚言語モデルを微調整して中央批評家として用いることで、方針学習中の批評家学習を不要にし、サンプル効率と汎化性を向上させるフレームワークを提案した。
原題: MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings / Shahil Shaik, Aditya Parameshwaran, Anshul Nayak 他
日本語で読む →