論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習ロボティクス
勾配衝突解消によるスケーラブルな多目的ロボット強化学習
多目的強化学習において、目的間の勾配衝突を優先度に基づいて解消するGCR-PPOを提案し、ロボットの操作・歩行ベンチマークで並列PPOより優れたスケーラビリティと性能を示した。
原題: Scalable Multi-Objective Robot Reinforcement Learning through Gradient Conflict Resolution / Humphrey Munn, Brendan Tidd, Peter Böhm 他
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
並列ソフトロボットによる動的タスクのためのリアルタイム強化学習
3Dプリントされた柔らかいアクチュエータで構成されたスチュワートプラットフォーム上で、カリキュラム学習を用いた強化学習により、動的バランス制御を実機でリアルタイムに学習させる手法を実証した。
原題: Real-Time Reinforcement Learning for Dynamic Tasks with a Parallel Soft Robot / James Avtges, Jake Ketchum, Millicent Schlafly 他
日本語で読む → - 論文ヒューマノイド/強化学習ロボティクス
PACE: 物理拡張による協調的エンドツーエンド強化学習で多様なヒューマノイド卓球を実現
ボール位置から全身の関節指令を直接出力する強化学習フレームワークを提案し、学習済み予測器と物理ベースの予測報酬でヒューマノイドの卓球を実現、実機でゼロショット展開した。
原題: PACE: Physics Augmentation for Coordinated End-to-end Reinforcement Learning toward Versatile Humanoid Table Tennis / Muqun Hu, Wenxi Chen, Wenjing Li 他
日本語で読む → - 論文強化学習/模倣学習/衛星計画AI
地球観測衛星の科学成果を高める学習ベースの計画手法
地球観測衛星の動的ターゲティングにおいて、強化学習と模倣学習を用いて観測地点の系列を計画し、既存のヒューリスティック手法より優れた性能を達成した。
原題: Learning-Based Planning for Improving Science Return of Earth Observation Satellites / Abigail Breitfeld, Alberto Candela, Juan Delfa 他
日本語で読む → - 論文強化学習/長期タスクcs.GR
バスケットボールの長期動作のためのポリシー合成学習
バスケットボールの長期にわたる複雑な動作を強化学習で実現するため、異なるスキルを組み合わせるポリシー統合フレームワークと、スムーズな遷移を可能にするソフトルーターを提案した。
原題: Learning to Ball: Composing Policies for Long-Horizon Basketball Moves / Pei Xu, Zhen Wu, Ruocheng Wang 他
日本語で読む → - 論文逆強化学習ロボティクス
対称性を活用したマルチエージェント逆強化学習
マルチエージェント系の対称性を利用して、少ない専門家デモから報酬関数を高精度に推定する逆強化学習フレームワークを提案し、実機マルチロボットでも検証した。
原題: Symmetry-Guided Multi-Agent Inverse Reinforcement Learning / Yongkai Tian, Yirong Qi, Xin Yu 他
日本語で読む → - 論文飛行制御/強化学習ロボティクス
CORB-Planner: 高速飛行におけるRLプランニングのための観測としてのコリドー
安全飛行コリドーを低次元観測として用い、Bスプライン軌道生成と強化学習を組み合わせることで、様々なドローン機体で高速自律飛行を実現するリアルタイム軌道計画フレームワークを提案した。
原題: CORB-Planner: Corridor as Observations for RL Planning in High-Speed Flight / Yechen Zhang, Bin Gao, Gang Wang 他
日本語で読む → - 論文強化学習AI
相互情報量が強化学習のポリシー整合性を追跡する
強化学習エージェントの学習過程と故障を状態-行動間の相互情報量で分析し、センサ故障とアクチュエータ故障を区別して診断できる情報理論的枠組みを提案した。
原題: Mutual Information Tracks Policy Coherence in Reinforcement Learning / Cameron Reid, Wael Hafez, Amirhossein Nazeri
日本語で読む → - 論文強化学習ロボティクス
断続的観測下における欺瞞的政策のオンライン学習
監視が時々しか行われない状況で、観測時に監督者の期待に沿うように振る舞いつつ私的目的を達成する欺瞞的行動を、心の理論を活用したオンライン強化学習で獲得する手法を提案し、船舶・ドローンの実験で有効性を示した。
原題: Online Learning of Deceptive Policies under Intermittent Observation / Gokul Puthumanaillam, Ram Padmanabhan, Jose Fuentes 他
日本語で読む → - 論文制御/強化学習ロボティクス
豊富な状態観測が強化学習をPID超えに導く:ドローンによるボールバランス制御研究
ドローンがケーブルで吊るしたビーム上のボールを安定させるタスクで、階層型制御の高レベル方策を強化学習で訓練し、PIDより優れることを示した。その優位性はパラメータ調整や非線形性ではなく、より豊富な状態観測の活用によることを明らかにした。
原題: Rich State Observations Empower Reinforcement Learning to Surpass PID: A Drone Ball Balancing Study / Mingjiang Liu, Hailong Huang
日本語で読む → - 論文言語支援・強化学習ロボティクス
メッセージのタイミング:時間制約のある支援環境における言語ベース通知
時間制約のある支援運転などの場面で、言語による通知の内容とタイミングのトレードオフを強化学習で最適化する枠組みを提案し、遅延を無視する手法より成功率を40%以上改善した。
原題: Timing the Message: Language-Based Notifications for Time-Critical Assistive Settings / Ya-Chuan Hsu, Jonathan DeCastro, Andrew Silva 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
周辺車両軌道予測とマルチモーダル入力を用いた自動運転車の車線変更意思決定のための深層強化学習
周辺車両の軌道予測と画像・センサのマルチモーダル情報を強化学習の状態空間に統合し、CARLAシミュレータで車線変更の安全性を向上させた研究。
原題: A Hybrid Input based Deep Reinforcement Learning for Lane Change Decision-Making of Autonomous Vehicle / Ziteng Gao, Jiaqi Qu, Chaoyu Chen
日本語で読む → - 論文マルチエージェント強化学習制御
自己注意機構付き方策勾配によるモデルフリー分散非線形マルチエージェントゲーム
非線形なマルチエージェントゲームにおいて、自己注意層でパラメータ化した非線形フィードバックゲインを方策勾配で学習する分散方策を提案し、線形・非線形制御やマルチロボット追跡逃避ゲームで有効性を示した。
原題: Policy Gradient with Self-Attention for Model-Free Distributed Nonlinear Multi-Agent Games / Eduardo Sebastián, Maitrayee Keskar, Eeman Iqbal 他
日本語で読む → - 論文Human-in-the-Loop強化学習ロボティクス
進捗に応じた選択的クエリで人間参加型強化学習を効率化
学習の停滞や悪化を検知したときだけ人間にフィードバックを求めるクエリ方策SPARQを提案し、常時フィードバックと同等の成功率を約半分のフィードバック量で達成した。
原題: Selective Progress-Aware Querying for Human-in-the-Loop Reinforcement Learning / Anujith Muraleedharan, Anamika J H
日本語で読む → - 論文マルチエージェント強化学習機械学習
好奇心は道を開く:マルチエージェント文脈校正による好奇心駆動型探索
マルチエージェント強化学習において、仲間の行動から文脈を推論して好奇心を動的に校正し、ノイズを除去して効率的な探索を実現する手法CERMICを提案。
原題: Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration / Yiyuan Pan, Zhe Liu, Hesheng Wang
日本語で読む → - 論文マルチロボット協調/強化学習ロボティクス
CRAFT: 基盤モデルを用いたマルチロボット協調タスクのための強化学習の自律的コーチング
大規模言語モデルと視覚言語モデルを「コーチ」として活用し、マルチロボット協調タスクをサブタスクに分解して報酬関数を生成・洗練することで、複雑な協調行動を自律的に学習するフレームワークCRAFTを提案。
原題: CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks / Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock 他
日本語で読む → - 論文強化学習/報酬設計AI
TimeRewarder:受動的動画からフレーム間時間距離で密報酬を学習
フレーム間の時間距離をモデル化し、ロボット実演や人間動画からタスク進捗を推定して強化学習の密報酬を生成する手法を提案。
原題: TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance / Yuyang Liu, Chuan Wen, Yihang Hu 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
CARLAシミュレータにおける自動運転のための強化学習の包括的レビュー
CARLAシミュレータで強化学習を用いた自動運転研究約100件を体系的に分析し、アルゴリズム、状態・行動・報酬設計、評価指標、課題と今後の方向性を整理したサーベイ。
原題: A Comprehensive Review of Reinforcement Learning for Autonomous Driving in the CARLA Simulator / Elahe Delavari, Feeza Khan Khanzada, Jaerock Kwon
日本語で読む → - 論文自己教師あり強化学習機械学習
VendiRL: 多様なスキルを自己教師あり強化学習で獲得するフレームワーク
生態学の多様性指標Vendi Scoreを強化学習に導入し、ユーザーが指定した多様性の形でスキルを評価・学習できる統合フレームワークVendiRLを提案した。
原題: VendiRL: A Framework for Self-Supervised Reinforcement Learning of Diversely Diverse Skills / Erik M. Lintunen
日本語で読む → - 論文安全強化学習ロボティクス
EigenSafe: 学習ベース確率的安全性評価のためのスペクトルフレームワーク
確率系の安全性確率を支配する線形作用素の主固有対を学習し、安全な強化学習や模倣学習ポリシーの安全性向上に応用する手法を提案。
原題: EigenSafe: A Spectral Framework for Learning-Based Probabilistic Safety Assessment / Inkyu Jang, Jonghae Park, Sihyun Cho 他
日本語で読む → - 論文マルチエージェント強化学習AI
リアルなAI戦闘機パイロットとの人間の交戦
マルチエージェント強化学習で訓練した戦闘機エージェントをVR-Forcesに統合し、人間とリアルタイムで交戦できるシステムを構築した。
原題: Towards Human Engagement with Realistic AI Combat Pilots / Ardian Selmonaj, Giacomo Del Rio, Adrian Schneider 他
日本語で読む → - 論文強化学習ロボティクス
PRIMT: 基盤モデルによるマルチモーダルフィードバックと軌道合成を用いた選好ベース強化学習
基盤モデルを活用してマルチモーダルな合成フィードバックと軌道生成を行い、人間の入力を減らしつつ選好ベース強化学習の曖昧さとクレジット割り当てを改善するフレームワークを提案。
原題: PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models / Ruiqi Wang, Dezhong Zhao, Ziqin Yuan 他
日本語で読む → - 論文強化学習制御
強化学習におけるオフポリシーリアプノフ安定性
オフポリシーでリアプノフ関数を学習し、SACやPPOに組み込むことで、データ効率の良い安定性保証を実現した研究。
原題: Off Policy Lyapunov Stability in Reinforcement Learning / Sarvan Gill, Daniela Constantinescu
日本語で読む → - 論文自動運転/強化学習ロボティクス
SEG-Parking: エンドツーエンドオフライン強化学習による安全・効率的・汎用的な自動駐車
駐車シーン用データセットを構築し、目標条件付き状態エンコーダと保守的正則化付きオフライン強化学習を組み合わせることで、対向車との相互作用を含む自動駐車を実現した研究。
原題: SEG-Parking: Towards Safe, Efficient, and Generalizable Autonomous Parking via End-to-End Offline Reinforcement Learning / Zewei Yang, Zengqi Peng, Jun Ma
日本語で読む → - 論文強化学習ライブラリロボティクス
RSL-RL: ロボティクス研究のための学習ライブラリ
ロボティクス研究向けに設計された軽量で拡張しやすい強化学習ライブラリを提案し、GPU特化の高速学習と実機実験での有効性を示した。
原題: RSL-RL: A Learning Library for Robotics Research / Clemens Schwarke, Mayank Mittal, Nikita Rudin 他
日本語で読む → - 論文強化学習機械学習
不確実性に基づく平滑方策正則化:少数のデモンストレーションを用いた強化学習
デモンストレーションと自身の方策のどちらを模倣すべきかをQ値の不確実性で判断し、連続的な正則化重みで学習を加速する手法SPReDを提案。8つのロボティクスタスクで最大14倍の性能向上を達成。
原題: Uncertainty-Based Smooth Policy Regularisation for Reinforcement Learning with Few Demonstrations / Yujie Zhu, Charles A. Hepburn, Matthew Thorpe 他
日本語で読む → - 論文マルチタスク強化学習ロボティクス
時間的に拡張された行動共有によるマルチタスク強化学習
マルチタスク強化学習において、関連タスクのポリシーを活用した行動共有とレヴィフライトに着想を得た時間的拡張探索を組み合わせ、サンプル効率を向上させる手法MT-Lévyを提案した。
原題: Leveraging Temporally Extended Behavior Sharing for Multi-task Reinforcement Learning / Gawon Lee, Daesol Cho, H. Jin Kim
日本語で読む → - 論文ビジュアルサーボ/強化学習制御
ニューラルネットワーク制御器の高速初期化手法:マルチコプタ迎撃における画像ベースビジュアルサーボ制御の事例研究
システムモデルに基づき安定条件を満たすデータセットを構築することで、ニューラルネットワーク制御方策の初期訓練を高速化する手法を提案し、マルチコプタ迎撃の画像ベースビジュアルサーボ制御で有効性を検証した。
原題: A Fast Initialization Method for Neural Network Controllers: A Case Study of Image-based Visual Servoing Control for the multicopter Interception / Chenxu Ke, Congling Tian, Kaichen Xu 他
日本語で読む → - 論文連続体ロボット/強化学習ロボティクス
変形可能な連続体ロボットの動的腔内ナビゲーションのためのヤコビアン探索的二段階強化学習
変形連続体ロボットの制御において、局所探索でヤコビアンを推定し状態表現を拡張する二段階強化学習を提案し、収束速度・ナビゲーション効率・未知環境への汎化性能を向上させた。
原題: Jacobian Exploratory Dual-Phase Reinforcement Learning for Dynamic Endoluminal Navigation of Deformable Continuum Robots / Yu Tian, Chi Kit Ng, Hongliang Ren
日本語で読む → - 論文マルチエージェント強化学習機械学習
共通ノイズ付き平均場ゲームのための母集団適応型オンラインミラー降下法
共通ノイズや未知の初期分布に対応するため、深層強化学習とオンラインミラー降下法を組み合わせ、母集団依存のナッシュ均衡を効率的に学習する手法を提案した。
原題: Population-aware Online Mirror Descent for Mean-Field Games with Common Noise by Deep Reinforcement Learning / Zida Wu, Mathieu Lauriere, Matthieu Geist 他
日本語で読む →