論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/強化学習ロボティクス
弾性クエリ強化学習:VLAモデルの自己認識型ポリシー実行
VLAモデルの推論・再計画スケジュールを固定せず、状態の難易度に応じてクエリの入力・ノイズ除去予算・アクション長を動的に調整する枠組みEQRLを提案。軽量な適応器と批評家の不一致による難易度信号で計算資源を効率的に配分し、シミュレーションと実機で推論コストを削減しつつ成功率を維持・向上させた。
原題: Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models / Ge Wang, Xinyu Tan, Xiang Li 他
日本語で読む → - 論文モデルベース強化学習ロボティクス
PRISM: ワールドモデルにおける事前知識誘導型想像サンプリング
学習済みワールドモデルを用いたプランニングにおいて、候補アクションの生成を事前分布で誘導する手法を提案。軽量なMLPで状態条件付きガウス事前分布を予測し、プランナーのサンプリング分布に融合することで性能を向上させた。
原題: PRISM: PRior-guided Imagination Sampling in world Models / Yuhai Wang, Jiawei Xia, Rongxuan Zhou 他
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
線形埋め込み空間での強化学習によるソフトロボット構成横断的な汎用制御
ソフトロボットの多様な形態・構成に迅速に適応できる汎用制御システムを、共有の線形Koopman埋め込み空間での強化学習により実現した。33構成で検証し、転移サンプルを75倍削減しつつ堅牢な性能を示した。
原題: Reinforcement learning in linear embedding space unlocks generalizable control across soft robot configurations / Xinglong Zhang, Cong Li, Hangjie Mo 他
日本語で読む → - 論文強化学習/報酬設計機械学習
報酬設計エージェント:強化学習のための報酬設計
視覚言語モデルを用いて報酬関数を自動設計・改善するエージェントフレームワークを提案し、指示に沿ったロボット操作ポリシーを実現した。
原題: RDA: Reward Design Agent for Reinforcement Learning / Hojoon Lee, Ajay Subramanian, Ben Abbatematteo 他
日本語で読む → - 論文強化学習/制御ロボティクス
固定翼UAVコマンド監視のためのHJB由来有限アクションリスクフィルタリングを備えたオートパイロット保存残差Q学習
固定翼UAVのオートパイロットを変更せず、その上に学習ベースの監視層を置き、風や乱気流下での追従誤差を大幅に低減する手法を提案した。
原題: Autopilot-Preserving Residual Q-Learning with HJB-Inspired Finite-Action Risk Filtering for Fixed-Wing UAV Command Supervision / Mehmet Iscan, Batuhan Temiz
日本語で読む → - 論文強化学習ロボティクス
因果報酬ワールドモデル:自動スキル生成のためのゼロショット報酬設計
因果関係を明示的にモデル化した報酬ワールドモデルを提案し、LLMによる報酬生成を因果的制約で導くことで、環境フィードバックなしのゼロショット報酬設計を実現した。
原題: Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation / Yang Yang, Yuchuang Tong, Zhengtao Zhang 他
日本語で読む → - 論文強化学習機械学習
視覚言語モデルのガイダンスによるポテンシャルベース報酬整形の自動化
視覚言語モデル(VLM)のフィードバックを用いてポテンシャル関数を学習し、報酬整形を自動化するフレームワークVLM-PBRSを提案した。スパース報酬環境での学習を加速しつつ、最適方策を保持することを実証した。
原題: Automating Potential-based Reward Shaping with Vision Language Model Guidance / Henrik Müller, Daniel Kudenko
日本語で読む → - 論文制御/強化学習ロボティクス
車輪付き四足ロボットのレース: モデル予測制御による能動的荷重移動の緩和
四足ロボットのレース中に発生する横方向の荷重移動を、MPCと強化学習を組み合わせた階層制御で能動的に抑制し、旋回性能と安定性を向上させた。
原題: Racing a Wheeled Quadruped: Active Load Transfer Mitigation via Model Predictive Control / Marla Eisman, Brian Lam, Samuel Sonnino 他
日本語で読む → - 論文強化学習/操作ロボティクス
FlowDPG: フローマッチングポリシーに対する決定論的ポリシー勾配の実世界操作への応用
フローマッチングポリシーにDDPGスタイルの強化学習を適用する際、時間方向の逆伝播(BPTT)を回避する蒸留フレームワークを提案し、実世界の長期的な両腕組み立てタスクで92%の成功率を達成した。
原題: FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation / Kexin Shi, Junyao Shi, Poorvi Hebbar 他
日本語で読む → - 論文ロコモーション/強化学習ロボティクス
RoboNaldo: 動作誘導カリキュラム強化学習による正確で安定かつ強力なヒューマノイドサッカーシュート
人間のキック動作を参照として段階的に最適化する3段階カリキュラム強化学習フレームワークを提案し、ヒューマノイドロボットによる高インパルスで正確なサッカーシュートを実現した。
原題: RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning / Yichao Zhong, Yidan Lu, Yuhang Lu 他
日本語で読む → - 論文VLA/強化学習/折りたたみロボティクス
折りたたみ学習:LeHomeチャレンジ2026優勝ソリューション(オンライン1位、オフライン2位)
両腕ロボットによる衣類折りたたみ競技会で、VLAポリシーに強化学習ループを組み合わせ、オンライン1位・実機2位を獲得したシステムを提案。
原題: Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline) / Ilia Larchenko
日本語で読む → - 論文強化学習ロボティクス
効果的なポリシー平滑化のための正則化の再設計
強化学習におけるポリシー関数の平滑化を効果的に行うため、既存の正則化手法の問題点を特定し、改良した正則化を提案する論文。複数のタスクとアルゴリズムで性能向上と滑らかな動作を実現し、四足ロボットのsim-to-real学習で目標速度の急変に対する頑健性を示した。
原題: Redesigning Regularization for Effective Policy Smoothing / Taisuke Kobayashi, Naoto Yamanaka
日本語で読む → - 論文マルチエージェント強化学習機械学習
個別制御バリア関数ガイド拡散モデルによる安全なオフラインマルチエージェント強化学習
オフライン強化学習に拡散モデルを用い、個別の制御バリア関数を組み込むことで、マルチエージェント環境での安全な軌道生成を実現する新しいアルゴリズムを提案した。
原題: Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning / Qingyun Guo, Junyi Shi, Jianuo Huang 他
日本語で読む → - 論文強化学習ロボティクス
意味的強化学習による汎用ロボットポリシーの適応
汎用ロボットポリシーを強化学習で適応させる際、アクション空間ではなく言語プロンプト空間を最適化する手法を提案し、複雑な長期的タスクを解決できることを示した。
原題: Adapting Generalist Robot Policies with Semantic Reinforcement Learning / Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen 他
日本語で読む → - 論文制御/強化学習ロボティクス
平均電力予算制約下での水中ビークル制御:制約付き強化学習によるアプローチ
水中ビークルのスラスタ消費電力を明示的な予算制約として扱う制約付き強化学習(PPO-Lagrangian)を提案し、タスク精度を保ちつつ消費電力を削減する制御器を学習する。
原題: Average-Power-Budgeted Underwater Vehicle Control via Constrained Reinforcement Learning / Yinuo Wang, Gavin Tao, Yuze Liu 他
日本語で読む → - 論文強化学習/ドローンレース/ゼロショット汎化ロボティクス
強化学習による敏捷な飛行における性能と汎化の橋渡し
ドローンレースの強化学習において、タスク認識型スイッチングと物理情報に基づく手続き型トラック生成器を組み合わせ、テスト時適応なしでゼロショット汎化を実現するフレームワークを提案した。
原題: Bridging Performance and Generalization in Reinforcement Learning for Agile Flight / Jonathan Green, Jiaxu Xing, Nico Messikommer 他
日本語で読む → - 論文強化学習/医療ロボティクスロボティクス
RobOralScan: ロボットによる歯科再構成のための能動的口腔内スキャン学習
強化学習を用いて、ロボットが自動で口腔内をスキャンし、歯の3次元再構成を行う初のパイプラインを提案した論文。
原題: RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction / Jinhyung Lee, Haeun Yun, Siwon Kim 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
PlanRL: 強化学習ベース運転エキスパートのための軌道計画アーキテクチャ
強化学習による自動運転エージェントが直接制御コマンドを出力する問題を解決するため、ポリノミアル軌道プランナと統合した新しいアーキテクチャを提案。Frenet座標系と運動学的実現可能性チェックを導入し、CARLAベンチマークで既存手法を上回る性能を達成した。
原題: PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts / Joonhee Lim, Yongjae Lee, Jangho Shin 他
日本語で読む → - 論文強化学習機械学習
正則化された報酬・罰則強化学習
報酬追求と罰則回避のポリシーを相互に事前分布として連携させるフレームワークKCPRを提案し、その深層実装klDMPがグリッドワールドとロボットナビゲーションで安全性と学習安定性を向上させることを示した。
原題: Regularized Reward-Punishment Reinforcement Learning / Jiexin Wang, Eiji Uchibe
日本語で読む → - 論文自動運転/強化学習ロボティクス
自動運転の高速道路走行のための安全強化学習:安全性と効率性を両立する統合フレームワーク
高速道路自動運転向けに、安全距離・報酬機械・混合専門家を統合した安全強化学習フレームワークを提案し、CARLAシミュレーションで安全性と効率性の向上を実証した。
原題: Safe Reinforcement Learning of Autonomous Highway Driving: A Unified Framework for Safety and Efficiency / Chufei Yan, Zhihao Cui, Yiyan Lv 他
日本語で読む → - 論文強化学習ロボティクス
敵対的姿勢正則化による人間らしいキネマティクスの巧みなピアノ演奏への適用
強化学習でピアノを弾く高自由度ロボットハンドの不自然な姿勢を、少量の人間の演奏データを使った敵対的学習で人間らしく矯正する手法を提案した。
原題: Enforcing Human-like Kinematics in Dexterous Piano Playing via Adversarial Posture Regularization / Bin Qiu, Yanming Shao, Guanyu Cai 他
日本語で読む → - 論文模倣学習/強化学習ロボティクス
ConTrack: 適応的トレードオフ制御による拘束付き手の動作追跡
物体追跡を制約とし、残りの制御権を動作忠実度に割り当てる強化学習フレームワークを提案。長期的な接触豊富な手の動作追跡を安定化し、シミュレーションと実ロボットで精度を向上させた。
原題: ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control / Yutong Liang, Quanquan Peng, Ri-Zhao Qiu 他
日本語で読む → - 論文強化学習/制御ロボティクス
双方向推力を用いたクアッドローターの強化学習による敏捷な転倒復帰
クアッドローターが任意の姿勢で地面に接地した状態から、軽量なオンボードセンサのみを用いて安定ホバリングまで自律復帰する強化学習フレームワークを提案した。非対称アクター・クリティックとINDI制御を組み合わせ、シミュレーションと実機実験でロバスト性を実証した。
原題: Agile Fall Recovery for Quadrotors with Bidirectional Thrust via Reinforcement Learning / Anke Zhao, Yuhang Zhong, Kenghou Hoi 他
日本語で読む → - 論文安全強化学習機械学習
滑らかな安全性構造化ポリシー合成による安全なオンライン学習
安全性監視と介入を行動生成に統合したポリシーアーキテクチャAutoSafeを提案し、性能追求と安全確保の行動を滑らかに切り替えることで、学習の滑らかさを保ちつつ安全性を確保する。
原題: Safe Online Learning via Smooth Safety-Structured Policy Composition / Hongpeng Cao, Liqun Zhao, Yuliang Gu 他
日本語で読む → - 論文強化学習/報酬設計ロボティクス
強化学習のための段階遷移型高密度報酬モデリング
専門家のデモ動画からタスクの段階構造を推論し、段階遷移と段階内進捗の2つの報酬信号を生成することで、長期的なロボット操作タスクの強化学習を効率化する手法を提案した。
原題: Stage-Transition Dense Reward Modeling for Reinforcement Learning / Yang Yang, Bingjie Chen, Zihan Wang 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
マルチエージェント強化学習による協調的な長縄跳び
複数の人型ロボットが協力して長縄跳びを行うためのマルチエージェント強化学習フレームワークを提案し、シミュレーションと実機でその有効性を実証した。
原題: Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning / Zihao Wang, Shijie Peng, Kerui Wu 他
日本語で読む → - 論文VLA/強化学習ロボティクス
Q-VGM: フローマッチングVLAのオフポリシー強化学習のためのQ値勾配マッチング
フローマッチング型VLAポリシーの微調整において、Q関数の勾配を利用して価値改善を効率的に行う新しいオフポリシー強化学習手法Q-VGMを提案した。
原題: Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA / Ziqian Wang, Yitian Liu, Xingjian Mao 他
日本語で読む → - 論文UAV着陸/強化学習画像認識
マルチモーダルエージェントAIと能動的波浪補償による海事プラットフォームへの堅牢なUAV自律着陸
波浪による動揺を補償する安定化プラットフォームを備えたUSVと、強化学習エージェントで制御されるUAVを連携させ、海事プラットフォームへの安全な自律着陸を実現する枠組みを提案した。
原題: Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation / Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho 他
日本語で読む → - 論文VLA/強化学習ロボティクス
本能を信じよ:視覚言語行動モデルのための信頼度駆動型テスト時強化学習
視覚言語行動モデル(VLA)が内部の評価能力を持ち、高信頼度の軌道が成功しやすいことを利用し、外部報酬なしで自己改善するテスト時強化学習フレームワークT^2VLAを提案した。
原題: Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models / Siyao Chen, Jiakang Yuan, Jiaxin Wang 他
日本語で読む → - 論文強化学習/適応ロボティクス
動力学は教えられるものではなく学習されるもの:潜在動力学幾何の半教師あり発見によるゼロショット方針適応
ロボット強化学習において、環境の動力学変化に頑健に適応するため、物理パラメータを明示せずに相互作用の結果から潜在空間の幾何構造を学習する手法を提案し、MuJoCoベンチマークで既存手法を上回る性能を示した。
原題: Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation / Zhiming Xu, Weitao Zhou, Xianghui Pan 他
日本語で読む →