論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/18 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習AI
報酬をエージェントとして捉える身体化ワールドモデルの学習
身体化ワールドモデルにおいて、報酬をエージェントとして能動的に評価する枠組みと、動的差分に基づく探索多様化手法を導入し、報酬ハッキングを抑えつつ多様な行動生成を可能にする強化学習手法を提案した。
原題: Reward as An Agent for Embodied World Models / Pu Li, Zhigang Lin, Qiang Wu 他
日本語で読む → - 論文メタ強化学習AI
メタ強化学習における知識再利用フレームワーク
メタ強化学習で、単純化したエージェントで学習したタスク知識を異なる形態のエージェントに転移するフレームワークを提案し、追従誤差を大幅削減しデータ効率を向上させた。
原題: Knowledge Reutilization in Meta-Reinforcement Learning / Yuan Meng, Bo Wang, Juan de los Rios Ruiz 他
日本語で読む → - 論文シミュレーション/強化学習画像認識
食品破壊シミュレーションにおける逆材料推定のための潜在空間強化学習
食品の破壊挙動から材料パラメータを推定する逆問題を、強化学習を用いて解く手法を提案。オレンジの皮むきを例に、目標条件付きポリシーが単一の順伝播で材料推定を行い、CMA-ESによる改良と組み合わせることで高精度な推定を実現した。
原題: Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation / Adrian Ramlal, Yuhao Chen, John S. Zelek
日本語で読む → - 論文ヒューマノイド操作/VLA/強化学習ロボティクス
ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
原題: ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning / Wei Xiao, Weiliang Tang, Yuying Ge 他
日本語で読む → - 論文強化学習機械学習
方向条件付きポリシー:構成部分ゴールスコアリングによるオンライン目標条件付き強化学習
目標までの距離の勾配のみに依存する方向条件付きポリシーを提案し、オンライン目標条件付き強化学習の性能を向上させた。
原題: Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning / Swaminathan S K, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan 他
日本語で読む → - 論文モデルベース強化学習機械学習
BRICKS-WM: インターフェース合成力学による構造化世界モデルの再利用性構築
モデルベース強化学習において、環境ダイナミクスをエージェントと背景のモジュールに分離し、学習済み背景モジュールを再利用可能にする構造化世界モデルフレームワークを提案した。
原題: BRICKS-WM: Building Reusability via Interface Composition Kinetics for Structured World Models / Shaowei Zhang, Jiahan Cao, Xunlan Zhou 他
日本語で読む → - 論文強化学習機械学習
大規模並列オン方策強化学習のための信頼領域拡散ポリシー
大規模並列シミュレーションを用いたオン方策強化学習で拡散ポリシーを安定して訓練する手法TruDiを提案し、多様なベンチマークで性能を実証した。
原題: Trust-Region Diffusion Policies for Massively Parallel On-Policy RL / Huy Le, Onur Celik, Denis Blessing 他
日本語で読む → - 論文安全強化学習機械学習
証明可能な安全性を備えつつスケーラブルな強化学習
安全な強化学習において、学習したバックアップポリシーを用いて暗黙的な制御不変集合を生成し、微分可能な射影層で安全性を厳密に保証する2段階フレームワークPS2-RLを提案した。
原題: Provably Safe, Yet Scalable Reinforcement Learning / Kai S. Yun, Zeyang Li, Navid Azizan
日本語で読む → - 論文強化学習/計画AI
因果オブジェクト中心モデルによるモンテカルロ木探索計画
オブジェクト中心表現と因果注意を組み合わせたモデルベース強化学習アルゴリズムCOMETを提案し、複数のベンチマークで初期学習性能を向上させた。
原題: Causal Object-Centric Models for Planning with Monte Carlo Tree Search / Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik 他
日本語で読む → - 論文強化学習/組み込みシステム制御
TetraRL: オンデバイス深層強化学習システムのための自己適応型ランタイム
本論文は、リソース制約のある組み込みデバイス上でDRLを実行する際に、リアルタイム性、報酬、メモリ、エネルギーという4つの目的を動的にバランスする自己適応型ランタイムフレームワークTetraRLを提案する。
原題: TetraRL: A Self-Adaptive Runtime for On-Device Deep Reinforcement Learning Systems / Zexin Li, Soheil Shirvani, Cong Liu
日本語で読む → - 論文強化学習/拡散ポリシー機械学習
QPILOTS: フローポリシーのための効率的なテスト時Qステアリング
フローマッチングや拡散ポリシーを強化学習で最適化する際、推論時にノイズ除去プロセスをQ値の勾配で操縦する手法QPILOTSを提案し、オフラインからオンラインへのRLベンチマークで高い成功率を達成した。
原題: QPILOTS: Efficient Test-Time Q-Steering for Flow Policies / Yifan Ruan, Chenyang Cao, Andreas Burger 他
日本語で読む → - 論文強化学習ロボティクス
UniIntervene: 実世界強化学習の効率化のためのエージェント介入
人間参加型強化学習における介入コストを削減するため、非生産的な探索を検知し自律的に回復行動を生成するエージェント介入モデルUniInterveneを提案した。
原題: UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning / Haoyuan Deng, Yitong Gao, Yudong Lin 他
日本語で読む → - 論文強化学習ロボティクス
対比的相互作用による物体操作のゼロからの学習
強化学習における対比学習が操作タスクで苦戦する原因を分析し、相互作用を考慮したリサンプリング手法(IWR)を提案して、シミュレーションと実機のエアホッケーで性能を向上させた。
原題: Learning Object Manipulation from Scratch via Contrastive Interaction / Tongle Shen, Caleb Chuck, Fan Feng 他
日本語で読む → - 論文強化学習機械学習
PAWS: アドバンテージ重み付きセグメントを用いた選好学習
人間の軌道比較から報酬を学習する選好ベース強化学習において、訓練と推論の不一致による分布シフトを分析し、セグメントレベルのアドバンテージ関数を直接用いた政策更新手法PAWSを提案した。ロボット操作・移動タスクで既存手法を上回る性能を示した。
原題: PAWS: Preference Learning with Advantage-Weighted Segments / Aleksandar Taranovic, Onur Celik, Niklas Freymuth 他
日本語で読む → - 論文強化学習機械学習
封印監査における符号付き圧縮進捗はグッドハート耐性を持つ
本論文は、世界モデルの圧縮進捗を報酬とする内在的動機付けが、封印された監査損失の符号付き減少として定義されると、累積報酬が監査改善に一致し、偽の進捗を無限に押し上げられないことを証明した。
原題: Signed Compression Progress on a Sealed Audit is Goodhart-Resistant / Ayush Mittal, Dhruv Gupta
日本語で読む → - 論文拡散ポリシー/強化学習/モデルベース機械学習
MODIP: 拡散ポリシーのための効率的なモデルベース最適化
拡散ポリシーを強化学習で直接微調整する代わりに、ワールドモデルとモデル予測制御で高品質な軌道を生成し、それを教師信号として行動クローニング的に微調整するフレームワークを提案した。
原題: MODIP: Efficient Model-Based Optimization for Diffusion Policies / Zakariae El Asri, Philippe Gratias-Quiquandon, Nicolas Thome 他
日本語で読む → - 論文水中ロボット/強化学習ロボティクス
強化学習を用いた自律型水中ロボットのエンドツーエンドの動作計画と実行に向けて
本論文は、生のセンサーデータからスラスター指令へのエンドツーエンドの深層強化学習アプローチを提案し、高レベル方策と低レベル方策を階層的に組み合わせて水中ロボットの障害物回避と目標到達を実現する。
原題: Towards End to End Motion Planning and Execution for Autonomous Underwater Vehicles Using Reinforcement Learning / Elisei Shafer, Oren Gal
日本語で読む → - 論文強化学習/空中マニピュレーション機械学習
文脈的対比メタ強化学習による自律空中マニピュレーション
クワッドローターが多様なペイロードを自律的に把持・輸送・配送するための、文脈エンコーダと対比学習を組み合わせたメタ強化学習手法を提案。シミュレーションのみで訓練し、実機へ直接展開可能。
原題: Autonomous Aerial Manipulation via Contextual Contrastive Meta Reinforcement Learning / Lixuan Jin, Bingxuan Lan, Xinyi Bao 他
日本語で読む → - 論文強化学習機械学習
密度輸送によるフローマッチングポリシーの強化学習
フローマッチングポリシーを強化学習で微調整する新しいアルゴリズムRLDTを提案。最大エントロピーRL目的とSVGDを用いて輸送場を構築し、期待ターゲット推定で安定学習を実現。
原題: Reinforcement Learning for Flow-Matching Policies with Density Transport / Boshu Lei, Kostas Daniilidis, Antonio Loquercio
日本語で読む → - 論文強化学習機械学習
GenPO++: ヤコビアンフリー尤度比を用いた生成的方策最適化
フローベースの生成的方策を強化学習に適用する際、実行アクションの確率評価が難しい問題を、高次可逆ODEソルバーと履歴状態を利用して正確かつヤコビアンフリーな尤度比計算を実現する枠組みを提案した。大規模シミュレーションや実ロボット操作タスクで優れた性能を示した。
原題: GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios / Ke Hu, Shutong Ding, Panxin Tao 他
日本語で読む → - 論文強化学習機械学習
適応的質問と世界モデルプローブによる明示的行動モデルの学習
報酬のみで訓練されたエージェントの脆さを改善するため、明示的な記号的行動モデル(ESBM)を導入し、適応的質問と世界モデルプローブを用いて行動の仕組みを学習・検証する手法を提案した。
原題: Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes / Hikaru Shindo, Yu Deng, Teng Cao 他
日本語で読む → - 論文強化学習機械学習
表現学習がマルチタスク深層強化学習のスケーラビリティを実現する
モデルベース制御ではなく表現学習がマルチタスクRLのスケーラビリティの鍵であると主張し、予測的表現学習と高容量価値関数を組み合わせたモデルフリーアルゴリズムMR.Qを提案・評価した。
原題: Representation Learning Enables Scalable Multitask Deep Reinforcement Learning / Johan Obando-Ceron, Lu Li, Scott Fujimoto 他
日本語で読む → - 論文安全強化学習機械学習
説明可能な安全強化学習
シールドの決定を人間が解釈可能な形で説明するため、階層的な決定木を用いて安全リスクの分類と行動許可の理由を提示する手法を提案した。
原題: Explainably Safe Reinforcement Learning / Sabine Rieder, Stefan Pranger, Debraj Chakraborty 他
日本語で読む → - 論文安全強化学習ロボティクス
COP-Q: コレスキー順序射影による安全最優先ロボット制御強化学習
報酬と安全性のQ値の相関を考慮し、コレスキー分解で安全を優先しつつ報酬の過度な保守性を抑える新しい安全強化学習手法を提案した。ロボットの移動やナビゲーション実験で安全性とサンプル効率の向上を確認した。
原題: COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection / Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan 他
日本語で読む → - 論文強化学習機械学習
双対優位フィールド:オフライン目標条件付き強化学習のための方策抽出法
双対線形価値モデルから局所的な優位信号を抽出する方策抽出法を提案し、オフライン目標条件付き強化学習の性能を向上させた。
原題: Dual Advantage Fields / Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin 他
日本語で読む → - 論文VLA/強化学習ロボティクス
Z-1: 視覚言語行動モデルのための効率的強化学習
フローベースのVLAモデルに強化学習を適用し、公開データセットのみで24タスクの成功率を大幅に向上させた。
原題: Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models / Lang Cao, Renhong Chen, Luyi Li 他
日本語で読む → - 論文制御/強化学習ロボティクス
平均電力予算制約下での水中ビークル制御:制約付き強化学習によるアプローチ
水中ビークルのスラスタ消費電力を明示的な予算制約として扱う制約付き強化学習(PPO-Lagrangian)を提案し、タスク精度を保ちつつ消費電力を削減する制御器を学習する。
原題: Average-Power-Budgeted Underwater Vehicle Control via Constrained Reinforcement Learning / Yinuo Wang, Gavin Tao, Yuze Liu 他
日本語で読む → - 論文強化学習ロボティクス
物理アタリ:ロボット上でのリアルタイム強化学習のための堅牢でアクセスしやすいプラットフォーム
Atariコントローラを物理的に操作するロボットとゲーム画面を表示するデバイスを組み合わせ、実世界で強化学習アルゴリズムを研究できるシステム「Physical Atari」を構築した。低コストで堅牢な設計により、ロボット上での直接学習と適応の重要性を示した。
原題: Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots / Khurram Javed, Joseph Modayil, Gloria Kennickell 他
日本語で読む → - 論文共設計/進化計算/強化学習ロボティクス
浮力支援ロボットの挑戦的移動のためのガウス進化的スペシャリストによる高速共同設計
形態と制御を同時最適化するため、設計空間を分割して多様な行動を捉えるガウス進化的スペシャリスト(GES)を提案し、浮力支援脚ロボットBALLUで性能向上と障害物越えを実証した。
原題: Rapid co-design of Buoyancy-assisted robots for Challenging Locomotion using Gaussian Evolutionary Specialists / Ankit Sinha, Nitish Sontakke, Dennis Hong 他
日本語で読む → - 論文強化学習ロボティクス
意味的強化学習による汎用ロボットポリシーの適応
汎用ロボットポリシーを強化学習で適応させる際、アクション空間ではなく言語プロンプト空間を最適化する手法を提案し、複雑な長期的タスクを解決できることを示した。
原題: Adapting Generalist Robot Policies with Semantic Reinforcement Learning / Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen 他
日本語で読む →