論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/12 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
最適Qガイダンスによるフローマップポリシーの整合
拡散やフローマッチングに基づく生成ポリシーの推論コストを削減するため、任意のジャンプ(1ステップを含む)を学習するフローマップポリシーを提案し、オフラインからオンラインへの強化学習において、批評家のQ値に基づく信頼領域最適化で適応させる手法を導入した。
原題: Aligning Flow Map Policies with Optimal Q-Guidance / Christos Ziakas, Alessandra Russo, Avishek Joey Bose
日本語で読む → - 論文強化学習/セキュリティ機械学習
Plan2Cleanse: モンテカルロ計画による深層強化学習のテスト時バックドア防御
強化学習モデルに埋め込まれたバックドア攻撃を、再学習なしでテスト時に検出・無害化するフレームワークを提案。モンテカルロ木探索を計画問題として適用し、ブラックボックスでトリガー探索と防御的再計画を行う。
原題: Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning / Sze-Ann Chen, Zhi-Yi Chin, Kui-Yuan Chen 他
日本語で読む → - 論文世界モデル/強化学習AI
マスク拡散言語モデルはエージェント強化学習のための強力で制御可能なテキストベース世界モデルである
テキストベースの世界モデルを、初期状態やタスク文脈などの要素に分解し、マスク拡散言語モデルが自己回帰モデルより優れた一貫性と多様性を持つことを示し、強化学習の訓練環境として有効なフレームワークを提案した。
原題: Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL / Darshan Deshpande
日本語で読む → - 論文強化学習機械学習
複雑なカードゲームのための因果強化学習:マジック・ザ・ギャザリングのベンチマーク
因果強化学習のための複雑なベンチマークとして、マジック・ザ・ギャザリングを用いた環境を構築し、因果構造を活用するエージェントを提案・評価した。
原題: Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark / Cristiano da Costa Cunha, Ajmal Mian, Tim French 他
日本語で読む → - 論文モデルベース強化学習AI
AGWM: 構成的前提条件を持つ環境のためのアフォーダンス基盤世界モデル
行動の実行可能性を左右する前提条件をDAGで明示的に追跡する世界モデルを提案し、多段階予測誤差の低減と解釈性向上を実証した。
原題: AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites / Qinshi Zhang, Weipeng Deng, Zhihan Jiang 他
日本語で読む → - 論文強化学習機械学習
基礎方針を用いた多段階計画のための到達時間同型性
オフライン強化学習において、到達時間観測から制御マルコフ過程の有向時間幾何を復元する新しい作用素論的表現学習フレームワークを提案し、基礎方針学習アルゴリズムIELを開発した。
原題: Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies / Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok 他
日本語で読む → - 論文強化学習機械学習
大規模言語モデルによる強化学習インターフェースの発見
強化学習のタスク設定に必要な観測と報酬のインターフェースを、大規模言語モデルを用いた進化的フレームワークLIMENで自動生成する手法を提案した。
原題: Discovering Reinforcement Learning Interfaces with Large Language Models / Akshat Singh Jaswal, Ashish Baghel, Paras Chopra
日本語で読む → - 論文自動運転/VLA/強化学習ロボティクス
MAPLE: 潜在マルチエージェントプレイによるエンドツーエンド自動運転
VLAモデルを閉ループで訓練するため、潜在空間でマルチエージェントのロールアウトを行い、強化学習で安全・進捗・多様性を最適化するフレームワークを提案。外部シミュレータ不要でスケーラブルな閉ループ訓練を実現し、Bench2DriveでSOTAを達成。
原題: MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving / Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng 他
日本語で読む → - 論文ロボット操作/強化学習機械学習
マルチモーダル生成ポリシーの微調整のための行動モード発見
強化学習による生成ポリシーの微調整で行動の多様性が失われる問題に対し、潜在的な行動モードを教師なしで発見し、相互情報量を内在報酬として利用することで、タスク成功率を保ちつつ多様な行動を維持する手法を提案した。
原題: Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies / Alberta Longhini, David Emukpere, Jean-Michel Renders 他
日本語で読む → - 論文ドローン/衝突耐性/強化学習ロボティクス
HoLoArm: 衝突に耐えるクアッドローターのための変形可能アーム
トンボの翅の結節構造に着想を得た柔軟アームを持つクアッドローターを提案し、強化学習制御により衝突後の回復と安定飛行を実現した。
原題: HoLoArm: Deformable Arms for Collision-Tolerant Quadrotor Flight / Quang Ngoc Pham, Jonas Eschmann, Yang Zhou 他
日本語で読む → - 論文強化学習/連続制御ロボティクス
ZAPS-DA: ゼロ位相アクション平滑化と分離アクターによる強化学習の連続制御
強化学習で訓練された連続制御ポリシーの高周波なアクションジッタを、位相遅れをほぼ生じさせずに低減する新しい手法を提案。主アクターとは別の分離アクターをゼロ位相フィルタ済みターゲットへの模倣学習で訓練し、推論時はフィルタ不要で平滑なアクションを出力する。
原題: ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning / Faiq Shamass
日本語で読む → - 論文遠隔操作/強化学習ロボティクス
確率的遅延下でのロボット遠隔操作のための残差強化学習
確率的通信遅延による信号不連続性に対処するため、LSTMによる状態推定と残差強化学習を組み合わせたハイブリッド制御フレームワークを提案し、遅延下でも安定した遠隔操作を実現した。
原題: Residual Reinforcement Learning for Robot Teleoperation under Stochastic Delays / Kaize Deng, Zewen Yang
日本語で読む → - 論文強化学習機械学習
適応チャンクサイズのアクタークリティックと因果トランスフォーマーQネットワーク
強化学習における長期的・疎報酬タスク向けに、チャンクサイズを状態に応じて適応的に選択するアクタークリティック法を提案し、オフラインおよびオフラインからオンラインへの設定で最先端性能を達成した。
原題: ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network / Qian Chen, Junqiao Zhao, Hongtu Zhou 他
日本語で読む → - 論文安全強化学習機械学習
サンプリングに基づく安全強化学習
モデルベース強化学習において、動的モデルの不確かさを有限サンプルで近似し、学習中の安全性を保証するアルゴリズムを提案した。シミュレーションと実ロボットで安全な探索を実証した。
原題: Sampling-Based Safe Reinforcement Learning / Luca Vignola, Bruce D. Lee, Manish Prajapat 他
日本語で読む → - 論文強化学習機械学習
SHAP分析によるロボティクス強化学習の一般化性能向上:アルゴリズムとハイパーパラメータの影響解明
強化学習の性能がアルゴリズムやハイパーパラメータに敏感である問題に対し、SHAP値を用いて各設定の一般化ギャップへの寄与を定量分解し、その知見に基づく設定選択で一般化性能を向上させる枠組みを提案した。
原題: Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters / Lingxiao Kong, Cong Yang, Oya Deniz Beyan 他
日本語で読む → - 論文強化学習/不確実性/能動的知覚制御
認識の罠を打ち破る:複合不確実性下での能動的知覚
強化学習において、状態推定と動的モデルの不確実性が相互に絡み合う「認識の罠」が性能を大幅に劣化させることを示し、情報量に基づく能動的探索と適応的安全制約を備えたアーキテクチャを提案した論文。
原題: Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty / Chayan Banerjee, Ethan Goan
日本語で読む → - 論文強化学習/飛行制御ロボティクス
AcroRL: 双方向推力を用いたアグレッシブなクアッドローター反転飛行の学習
双方向推力を持つクアッドローターの反転飛行を強化学習で実現するフレームワークを提案し、シミュレーションと実機で性能を実証した。
原題: AcroRL: Learning Aggressive Quadrotor Inversion using Bidirectional Thrust / Gabriel Rodriguez, Henri Sayag, Abhishek Rathod 他
日本語で読む → - 論文ロボット学習/強化学習ロボティクス
TMRL: 拡散タイムステップ変調による事前学習が効率的なポリシー微調整のための探索を可能にする
ロボットポリシーの事前学習と強化学習による微調整を橋渡しする統一フレームワークを提案。事前学習時に拡散ノイズを注入し、微調整時にタイムステップを動的調整することで探索を制御し、複雑な操作タスクの実機微調整を1時間以内で成功させる。
原題: TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning / Matthew M. Hong, Jesse Zhang, Anusha Nagabandi 他
日本語で読む → - 論文強化学習/操作ロボティクス
ハイブリッド接触ダイナミクス下での物理情報を活用した目標条件付き強化学習
接触を伴う操作タスクで物理情報を活用した目標条件付き強化学習(Pi-GCRL)が劣化する問題を分析し、接触を考慮した階層的定式化を提案して性能を改善した。
原題: Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics / Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi
日本語で読む → - 論文強化学習機械学習
オフダイナミクス強化学習のためのクロスドメインエネルギー誘導拡散生成
遷移ダイナミクスが異なる環境間で、ソースデータセットからターゲット領域のポリシーを学習する際に、エネルギー誘導を用いて軌道レベルの拡散生成を行い、ターゲット領域に適応した合成データを生成する手法CEDGEを提案した。
原題: Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning / Yu Yang, Yihong Guo, Anqi Liu 他
日本語で読む → - 論文宇宙機マニピュレーション/強化学習ロボティクス
事前方針誘導による宇宙機-マニピュレータシステムのデュアルエージェント協調操作計画
宇宙機とマニピュレータの動的干渉を考慮し、エンドエフェクタの高精度到達とベース姿勢安定化を同時に実現するデュアルエージェント協調計画フレームワークを提案した。事前方針誘導型深層強化学習とタイムステップレベル専門家切替機構を導入し、学習効率と成功率を向上させた。
原題: Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System / Yuhui Hu, Dong Zhou, Kaihong Ouyang 他
日本語で読む → - 論文強化学習/転移学習ロボティクス
カスタムカーレース環境のための転移学習
深層強化学習において、あるサーキットで訓練したエージェントを別のカスタム環境に転移させ、ゼロショット転移や微調整で速いラップタイムを達成する手法を探求した。モデルベース手法がモデルフリー手法より性能と収束速度で優れることを示した。
原題: Transfer Learning for Customized Car Racing Environments / Benedict Florance Arockiaraj, Richard Chang, Wesley Yee
日本語で読む → - 論文強化学習機械学習
信頼領域Q-随伴マッチング
事前学習済みフローポリシーのオフポリシー強化学習を安定化するため、経路空間KLを信頼領域パラメータで制御するTRQAMを提案し、50のOGBenchタスクで既存手法を上回る性能を達成した。
原題: Trust Region Q Adjoint Matching / Yonghoon Dong, Kyungmin Lee, Changyeon Kim 他
日本語で読む → - 論文強化学習/航行ロボティクス
信頼・幾何・規則:不確実性下での安全なUSV航行のための信頼性認識強化学習フレームワーク
無人水上艇(USV)の安全でCOLREG準拠の自律航行を実現するため、信頼性重み付き価値学習、共分散膨張速度障害物、リスク認識COLREG義務埋め込みを統合した強化学習フレームワークを提案した。
原題: Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty / Yuhang Zhang, Shuqi Chai, Yukang Zhang 他
日本語で読む → - 論文安全強化学習機械学習
ParallelCBF: テンソル並列強化学習のための合成可能な安全フィルタと監査可能性フレームワーク
UAVシミュレーション、CBF安全フィルタ、BC-to-RLパイプライン、運用監査を統合した初のフレームワークを提案し、事前登録や監査APIにより再現性を高める。
原題: parallelcbf: A composable safety-filter and auditability framework for tensor-parallel reinforcement learning / Yijun Lu, Zilei Yang, Yuyin Ma
日本語で読む → - 論文触覚/強化学習/ベンチマークロボティクス
ロボ触覚オリンピアード2.0:触覚ベース強化学習の標準化ベンチマーク
触覚ベースの強化学習を標準化するため、4種類のロボット形態で「盲目的」操作を評価するGPU並列ベンチマークを提案し、既存手法より10倍高速な性能を達成した。
原題: roto 2.0: The Robot Tactile Olympiad / Elle Miller, Jayaram Reddy, Ayush Deshmukh 他
日本語で読む → - 論文強化学習/時間論理ロボティクス
時間論理のための価値関数:最適方策と安全フィルタ
時間論理仕様に対する価値関数の最適性と方策の最適性の微妙な関係を解明し、非マルコフ方策を用いて病理を回避する最適方策を構築するとともに、Q関数を複雑な時間論理仕様の安全フィルタとして利用する方法を示した論文。
原題: Value Functions for Temporal Logic: Optimal Policies and Safety Filters / Oswin So, William Sharpless, Sylvia Herbert 他
日本語で読む → - 論文強化学習機械学習
マインドドリーマー:潜在多様体への能動的因果介入による想像力の解放
モデルベース強化学習において、観測状態からではなく生成的初期状態から想像を開始することで、歴史的束縛を打破し、探索と報酬最適化の非対称性を解消する新しいフレームワークを提案した。
原題: Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds / Shaojun Xu, Xiaoling Zhou, Yihan Lin 他
日本語で読む → - 論文強化学習/システムアーキテクチャロボティクス
UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
原題: UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms / Yufei Jia, Zhanxiang Cao, Mingrui Yu 他
日本語で読む → - 論文VLA/強化学習/人間介入ロボティクス
UniSteer: 人間のガイダンスを活用したVLA適応のための統合ノイズステアリング
拡散型VLAモデルの実世界適応を効率化するため、人間の修正行動をノイズ空間の強化学習に統合するフレームワークUniSteerを提案。実機実験で成功率を平均66分で20%から90%に向上させた。
原題: UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation / Junjie Lu, Xinyao Qin, Yuhua Jiang 他
日本語で読む →