論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文投擲/強化学習ロボティクス
多障害物環境での安全な物体投擲の学習
ロボットが障害物を避けながら目標のかごに物体を投げ入れる問題を扱い、ポテンシャル場表現を用いた強化学習で成功率90%を達成した。
原題: Learning to Throw Objects Safely in Multi-Obstacle Environments / Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei
日本語で読む → - 論文強化学習/制御機械学習
軌道追従のための予測的強化学習
強化学習による軌道追従制御に予測情報を組み込み、シミュレーションで誤差を大幅削減。実機転送では単純な構成が最適であることを示した。
原題: Anticipatory Reinforcement Learning for Trajectory Tracking / Georg Schäfer, Jakob Rehrl, Stefan Huber 他
日本語で読む → - 論文VLA/強化学習ロボティクス
ExToken: 効率的なVision-Language-Action強化学習のための構造化探索
VLAモデルの強化学習における探索停滞問題を分析し、軌跡の多様性がサンプル効率に重要であることを示した上で、オフラインのデモから得た離散的な行動プリミティブに基づいて探索を構造化するExTokenフレームワークを提案した。
原題: ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning / Yilun Kong, Yunpeng Qing, Guozheng Ma 他
日本語で読む → - 論文強化学習ロボティクス
P3: VAEベースロボット学習のための確率的方策伝播
VAEベースの方策とPPOの理論的不整合を指摘し、分布を考慮した最適化フレームワークP^3を提案。データ効率と収束速度を大幅に改善した。
原題: P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning / Liyun Yan, Jianming Ma, Yang Zhang 他
日本語で読む → - 論文安全強化学習機械学習
モデル予測制御のアイデアを用いた安全な強化学習
強化学習の探索中に安全制約を厳守するため、モデル予測制御で計算した安全な状態-行動空間への射影を安全フィルタとして用いる枠組みを提案し、実機で検証した。
原題: Safe Reinforcement Learning using Ideas from Model Predictive Control / Georg Schäfer, Jakob Rehrl, Stefan Huber 他
日本語で読む → - 論文強化学習/カリキュラム学習/LLMロボティクス
LEACL: LLM強化による長期的操作タスクの強化学習のための自動カリキュラム学習
大規模言語モデル(LLM)を用いて複雑なタスクをサブタスクに分解し、各サブタスクの仕様を自動生成することで、スパース報酬のみで強化学習を効率的に行う自動カリキュラム学習フレームワークを提案した。
原題: LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks / Faraz Heravi, James Ouyang, Zifan Xu 他
日本語で読む → - 論文強化学習機械学習
実用的な転移制約下での強化学習アルゴリズムの適合性再考
転移指向の強化学習において、アルゴリズムの適合性をサンプル効率だけでなく、実時間効率とドメインランダム化への頑健性の観点から評価し、PPOがSACやTD-MPC2よりも実時間で高性能な方策を学習できることや、ドメインランダム化が異なるパラダイムのアルゴリズムに同様の影響を与えることを示した。
原題: Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints / Hany Hamed, Abhishek Naik, Colin Bellinger 他
日本語で読む → - 論文強化学習/ベンチマークロボティクス
強化学習による到達回避タスクの学習:ベクトル化シミュレーションとベンチマーク
ロボットアームの到達回避タスクを、現実的な複雑さを保ったまま強化学習で解くためのベンチマークを初めて構築し、MuJoCo MJXとBraxによる並列化で高成功率を達成した。
原題: Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark / Jonas Weihing, Shahram Eivazi
日本語で読む → - 論文強化学習/多目的最適化機械学習
ベイズ最適化を用いた省エネルギー強化学習のための高効率パレートフロントモデリング
強化学習の多目的最適化において、報酬関数の重み選択を多目的ベイズ最適化で自動化し、少ない評価回数で多様なトレードオフ解を発見する手法を提案・実証した。
原題: Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization / Georg Schäfer, Jakob Rehrl, Stefan Huber 他
日本語で読む → - 論文操作学習/強化学習/Sim-to-Realロボティクス
ゼロショットSim-to-Real転送を備えたマルチタスクブロック押し操作のための単一拡散ポリシーコントローラ
強化学習を用いて、複数の形状のブロックを押すマルチタスク操作を単一の拡散ポリシーで学習し、実世界へゼロショット転送できることを示した論文。
原題: A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer / Haitong Ma, Haldun Balim, Yang Hu 他
日本語で読む → - 論文強化学習/操作ロボティクス
HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
原題: HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models / Angen Ye, Weijie Ke, Xiaofeng Wang 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
遅延を考慮した能動三角測量:不確実性駆動型マルチエージェント強化学習による対UAS応用
対UASのためのマルチエージェント能動視覚三角測量において、遅延を明示的に扱う強化学習フレームワークを提案し、Age-of-Informationと不確実性伝播を導入して精度と安定性を向上させた。
原題: Delay-Aware Active Triangulation with Uncertainty-Driven Multi-Agent Reinforcement Learning for Counter-UAS / Seungwook Lee, David Hyunchul Shim
日本語で読む → - 論文オフライン強化学習機械学習
効率的なオフライン強化学習のためのショートカット軌道計画
拡散モデルによる軌道計画の推論コストを削減するため、単一ステージで学習可能なショートカット軌道モデルを提案し、ステップサイズ調整による1ステップ・数ステップ推論と、実現可能性補正付き批評家による計画選択を実現した。
原題: Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning / Guanquan Wang, Yoshimasa Tsuruoka
日本語で読む → - 論文水中ロボット/強化学習/sim2realロボティクス
CORAL-AUV: CFD指向の強化学習による自律型水中ビークル制御
CFDデータから学習したサロゲート抗力モデルを強化学習に組み込み、実機の6自由度AUVにゼロショットで適用可能な制御ポリシーを初めて実証した。従来の簡易物理モデルと比較して、エネルギー消費31%削減、移動時間11%短縮、誤差19%低減を達成した。
原題: CORAL-AUV: CFD Oriented Reinforcement Learning for Autonomous Underwater Vehicles / Steven Roche, Milo Van Mooy, Nathan McGuire 他
日本語で読む → - 論文触覚/強化学習ロボティクス
OmniTacTune: 視覚ポリシーへの触覚残差適応のためのポリシー非依存な実世界強化学習
事前学習済みの視覚ポリシーに触覚フィードバックを残差補正として適応させる、ポリシー非依存の実世界RLパイプラインを提案。接触を伴う多様なタスクで成功率を大幅に向上させる。
原題: OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies / Kelin Yu, Haode Zhang, Harish Ravichandar 他
日本語で読む → - 論文強化学習/ナビゲーションロボティクス
動的障害物環境での安全飛行のための予測リスク誘導強化学習
クアッドローターの動的環境での安全航行のため、将来の衝突リスクを予測するリスクマップを強化学習で自己予測させ、視覚ポリシーを誘導する手法を提案。シミュレーションから実機へのゼロショット転送に成功。
原題: Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter / Yuchao Mei, Guohao Zhang, Luxia Ai 他
日本語で読む → - 論文強化学習/制御ロボティクス
アクチュエータ動力学を考慮した物理認識型エンドツーエンド深層強化学習によるクアッドコプター制御
クアッドコプターの低レベル制御に、アクチュエータの遅れや空力モーメントを考慮した高忠実度シミュレータを用いたエンドツーエンド深層強化学習を適用し、DDPG、TD3、PPO、SACの性能を比較した。
原題: Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics / Ya-Chia Shen, Woei-Leong Chan
日本語で読む → - 論文逆強化学習機械学習
一般化と誘導:少数ショット逆強化学習のための報酬分解
少数の目標タスクデモと関連タスクのデモを用いて、新しいタスクの報酬を学習する逆強化学習手法を提案。報酬を一般化可能な判別器と近接関数に分解し、探索時の誘導を実現する。
原題: Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning / Ziyi Liu, Grace Zhang
日本語で読む → - 論文継続的強化学習機械学習
較正部分リセット:継続的強化学習における方策崩壊の防止
ニューロンのリセットを部分的かつ有用性に応じて調整することで、継続的強化学習での方策崩壊を防ぎつつ可塑性を維持する手法を提案した。
原題: Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning / Luc McCutcheon, Evangelos Chatzaroulas, Saber Fallah
日本語で読む → - 論文強化学習機械学習
視覚強化学習の汎化のためのタスク関連表現の分離
視覚強化学習の汎化性能向上のため、観測をタスク関連・非関連表現に分離する自己教師ありアルゴリズムT2RDを提案した。
原題: Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization / Jinwen Wang, Youfang Lin, Xiaobo Hu 他
日本語で読む → - 論文強化学習ロボティクス
PAC-ACT: アクション・チャンキング・トランスフォーマー向けのポストトレーニング型アクター・クリティック
事前学習済みのアクション・チャンキング・ポリシーに強化学習によるポストトレーニングを施し、精密な接触作業での分布シフトを改善するフレームワークを提案した。
原題: PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers / Yujie Pang, Zudong Li
日本語で読む → - 論文強化学習ロボティクス
SymmGrid: 並列対称性と自己中心・外界中心視覚知覚によるロボット実機学習の超高速化
ロボット実機での強化学習を高速化するため、対称性変換を並列化してリプレイバッファを多様な経験で満たすフレームワークSymmGridを提案し、実機操作タスクで学習時間を短縮し成功率を向上させた。
原題: SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception / Gabe Everett, Brice Gunter, Ryan Vander Stelt 他
日本語で読む → - 論文強化学習/制御ロボティクス
適応的強化学習による自律水上艇のクロスプラットフォーム制御
単一のポリシーで異なる水上艇にゼロショット適用可能な適応的強化学習手法を提案し、実機2機種で非適応ベースラインを最大58%上回る追従精度を達成した。
原題: Cross-Platform Control for Autonomous Surface Vehicles via Adaptive Reinforcement Learning / Ruiheng Jiang, Thomas Bi, Raffaello D'Andrea 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
通信喪失下でのロバストなマルチエージェント協調のための価値認識予測
通信が途切れる環境で、エージェントが欠落した状態情報を予測する際に、価値関数に基づく重み付けを導入し、予測モデルの学習を政策の進化に結びつける手法を提案した。
原題: Value-Aware Prediction for Robust Multi-Agent Coordination Under Communication Loss / Kemal Devrim Kafadar, Eren Özaltun, Mahmud Efnan Şanlı 他
日本語で読む → - 論文強化学習AI
海洋監視における異種センサ選択のための強化学習
船舶追跡のための異種センサネットワークにおいて、強化学習を用いて各時刻に最適なセンサを選択する手法を提案した。
原題: Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance / Andrei Starodubov, Yaqub Aris Prabowo, Andreas Hadjipieris 他
日本語で読む → - 論文VLA/強化学習ロボティクス
最適輸送Q学習によるフローポリシーの操縦と高速化
ロボットの経験を用いたRL後訓練により、準最適なフローベースポリシーを微調整・高速化する最適輸送Q学習(OTQL)を提案した。
原題: Optimal Transport Q-Learning for Flow Policy Steering and Acceleration / Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas 他
日本語で読む → - 論文強化学習機械学習
状態認識型探索を備えたデュアルフロー強化学習
連続制御タスクにおいて、報酬分布と方策分布をフローマッチングで同時にモデル化し、多峰性の探索を改善する新しいアクタークリティック手法を提案した。
原題: Dual-Flow Reinforcement Learning with State-Aware Exploration / Qijun Li, Zheng Fu, Qi Song 他
日本語で読む → - 論文強化学習機械学習
万能解を超えて:オフライン事前知識を用いた診断駆動型オンライン強化学習
オフライン事前知識の活用が強化学習に不可欠となる一方、その有効性は環境や学習過程で変化するため、単一の管理手法は最適でないと主張し、展開固有の証拠に基づく診断駆動型の緊張管理への転換を提案する論文。
原題: Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors / Guozheng Ma, Lu Li, Zilin Wang 他
日本語で読む → - 論文強化学習機械学習
ベルマン方程式の逆転:Q値から世界モデルへ
価値ベースの強化学習エージェントが十分な報酬関数で訓練されると、暗黙的に環境の遷移モデルを符号化することを証明し、そのモデルを抽出するP学習を提案した。
原題: Inverting the Bellman Equation: From $Q$-Values to World Models / Alistair Letcher, Mattie Fellows, Alexander D. Goldie 他
日本語で読む → - 論文強化学習/探索機械学習
報酬なし事前学習:占有被覆最大化による強化学習
報酬が疎な環境で、報酬を使わずに探索ポリシーを事前学習し、下流タスクで迅速に適応する手法ROVERを提案。占有度のエントロピー最大化と仮想シンク状態で探索を促進する。
原題: Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization / Marco Pratticò, Pietro Novelli, Massimiliano Pontil 他
日本語で読む →