論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/11/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文モデルベース強化学習ロボティクス
夢見るファルコン:クアッドコプターのための物理情報に基づくモデルベース強化学習
クアッドコプターの制御にDreamerを適用する際、物理情報を組み込んだ世界モデルを提案し、標準的なRNNベースのモデルと比較した。
原題: Dreaming Falcon: Physics-Informed Model-Based Reinforcement Learning for Quadcopters / Eashan Vytla, Bhavanishankar Kalavakolanu, Andrew Perrault 他
日本語で読む → - 論文強化学習機械学習
一次ソボレフ強化学習
価値関数の値だけでなく状態・行動に対する微分もベルマンターゲットに一致させるソボレフ型損失を導入し、批評家の収束を速め方策勾配を安定化させるTD学習の改良を提案。
原題: First-order Sobolev Reinforcement Learning / Fabian Schramm, Nicolas Perrin-Gilbert, Justin Carpentier
日本語で読む → - 論文強化学習機械学習
LLMを活用した強化学習制御タスクの報酬関数設計
システムとタスクのテキスト記述から報酬関数を自律生成・評価するLLMベースのフレームワークLEARN-Optを提案し、事前知識なしでEUREKAに匹敵する性能を実現した。
原題: Leveraging LLMs for reward function design in reinforcement learning control tasks / Franklin Cardenoso, Wouter Caarls
日本語で読む → - 論文強化学習ロボティクス
SAC-MoE:不確実性を伴うハイブリッド力学系の制御のためのMixture-of-Expertsを用いた強化学習
ハイブリッド力学系の制御において、潜在モードと切替えの不確実性に対処するため、SACのアクターをMixture-of-Expertsでモデル化し、カリキュラム学習で訓練する手法を提案。未見環境へのゼロショット汎化性能を最大6倍向上させた。
原題: SAC-MoE: Reinforcement Learning with Mixture-of-Experts for Control of Hybrid Dynamical Systems with Uncertainty / Leroy D'Souza, Akash Karthikeyan, Yash Vardhan Pant 他
日本語で読む → - 論文強化学習ロボティクス
ベビー・ソフィア:自己接触と手の注視による自己探求の発達的アプローチ
乳児の発達に着想を得て、強化学習によりロボットが自己接触と手の注視を自律的に学習するフレームワークを提案し、好奇心ベースの内的報酬だけで協調的なマルチモーダル学習が可能なことを示した。
原題: Baby Sophia: A Developmental Approach to Self-Exploration through Self-Touch and Hand Regard / Stelios Zarifis, Ioannis Chalkiadakis, Artemis Chardouveli 他
日本語で読む → - 論文オフライン強化学習機械学習
価値条件付き最適化による拡散ポリシーを用いたオフライン強化学習
オフライン強化学習において、拡散モデルをアドバンテージ値で重み付けして訓練し、高リターン行動を選択的に拡張することで、保守性と探索性のバランスを取る手法DIVOを提案した論文。
原題: Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning / Yunchang Ma, Tenglong Liu, Yixing Lan 他
日本語で読む → - 論文強化学習機械学習
Dyna-Q強化学習のための予測型安全シールド
モデルベース強化学習において、安全な予測に基づいてQ関数を局所更新する安全シールドを提案し、安全性を保ちつつ性能を向上させる。
原題: Predictive Safety Shield for Dyna-Q Reinforcement Learning / Jin Pin, Krasowski Hanna, Vanneaux Elena
日本語で読む → - 論文無線ネットワーク/強化学習cs.IT
デュアルマインド世界モデル:動的無線ネットワークにおける学習のための汎用フレームワーク
認知心理学の二重過程理論に着想を得て、パターン駆動型のSystem 1と論理駆動型のSystem 2を組み合わせた世界モデルを提案し、mmWave V2X環境でのリンクスケジューリングを長期計画で最適化する。
原題: Dual-Mind World Models: A General Framework for Learning in Dynamic Wireless Networks / Lingyi Wang, Rashed Shelim, Walid Saad 他
日本語で読む → - 論文モデルベース強化学習機械学習
世界モデルを混乱させるのはどれほど難しいか
強化学習における「最も混乱させるインスタンス」の概念をニューラルネットワーク世界モデルに拡張し、制約付き最適化問題として定式化して敵対的訓練で解く手法を提案した。
原題: How Hard is it to Confuse a World Model? / Waris Radji, Odalric-Ambrym Maillard
日本語で読む → - 論文強化学習/世界モデル機械学習
DreamerV3-XP:不確実性推定による探索の最適化
世界モデル強化学習DreamerV3に優先経験再生とアンサンブル不確実性に基づく内的報酬を追加し、疎な報酬環境での探索と学習効率を改善した。
原題: DreamerV3-XP: Optimizing exploration through uncertainty estimation / Lukas Bierling, Davide Pasero, Jan-Henrik Bertrand 他
日本語で読む → - 論文強化学習/解釈可能性機械学習
埋め込み次元の増大が単純ソートタスクにおける世界モデルを強化する
強化学習でバブルソート風の隣接交換を学習するTransformerにおいて、埋め込み次元が内部世界モデルの形成に与える影響を調査し、次元が大きいほど構造的で解釈可能な表現が得られることを示した。
原題: Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task / Brady Bhalla, Honglu Fan, Nancy Chen 他
日本語で読む → - 論文強化学習機械学習
D2C-HRHR: 高リスク高リターンタスクのための離散行動と二重分布クリティック
高リスク高リターンなタスクでは行動分布が多峰的で報酬が確率的になるため、連続行動を離散化しエントロピー正則化と二重クリティックで価値分布を推定する強化学習フレームワークを提案した。
原題: D2C-HRHR: Discrete Actions with Double Distributional Critics for High-Risk-High-Return Tasks / Jundong Zhang, Yuhui Situ, Fanji Zhang 他
日本語で読む → - 論文強化学習テスト機械学習
多様性の追求:深層強化学習エージェントの多目的テスト
深層強化学習エージェントの安全性テストにおいて、失敗の多様性と発生しやすさを同時に最適化する多目的探索手法INDAGO-Nexusを提案し、従来手法より多くの固有の失敗を発見した。
原題: The Pursuit of Diversity: Multi-Objective Testing of Deep Reinforcement Learning Agents / Antony Bartlett, Cynthia Liem, Annibale Panichella
日本語で読む → - 論文強化学習機械学習
Deep SPI:世界モデルによる安全な方策改善
世界モデルと表現学習を組み合わせたオンライン強化学習において、方策更新を現在の方策の近傍に制限することで単調改善と収束を保証する理論的枠組みを構築し、その理論に基づくアルゴリズムDeepSPIを提案した論文。
原題: Deep SPI: Safe Policy Improvement via World Models / Florent Delgrange, Raphael Avalos, Willem Röpke
日本語で読む → - 論文強化学習機械学習
未知のダイナミクスを持つ多動物行動のデータ駆動型シミュレータ:オフライン・オンライン強化学習による実現
深層強化学習と反実仮想シミュレーションを用いて、未知の運動ダイナミクスを持つ多動物の行動を再現・予測するデータ駆動型シミュレータを構築した。
原題: Data-driven simulator of multi-animal behavior with unknown dynamics via offline and online reinforcement learning / Keisuke Fujii, Kazushi Tsutsui, Yu Teshima 他
日本語で読む → - 論文強化学習機械学習
目標条件付き強化学習のためのテスト時グラフ探索
既存の目標条件付き強化学習ポリシーに、学習不要の軽量なグラフ探索ラッパーを組み合わせることで、長期的タスクの成功率を大幅に向上させる手法を提案した。
原題: Test-Time Graph Search for Goal-Conditioned Reinforcement Learning / Evgenii Opryshko, Junwei Quan, Claas Voelcker 他
日本語で読む → - 論文モデルベース強化学習機械学習
計画としての時空間予測:生成的世界モデルを用いたモデルベース強化学習アプローチ
時空間予測をモデルベース強化学習の問題として捉え、生成的世界モデルとビーム探索による計画で非微分な評価指標を報酬として活用し、極端事象の捕捉精度を高める手法を提案した。
原題: Spatiotemporal Forecasting as Planning: A Model-Based Reinforcement Learning Approach with Generative World Models / Hao Wu, Yuan Gao, Xingjian Shi 他
日本語で読む → - 論文強化学習q-bio.NC
深層強化学習で訓練したRNNエージェントによるゼブラフィッシュ幼生の捕食行動の解析
深層強化学習で訓練したリカレントエージェントが、ゼブラフィッシュ幼生の捕食行動を再現し、その行動を生む最小限の制約条件を明らかにした。
原題: Dissecting Larval Zebrafish Hunting using Deep Reinforcement Learning Trained RNN Agents / Raaghav Malik, Satpreet H. Singh, Sonja Johnson-Yu 他
日本語で読む → - 論文強化学習機械学習
D2AC:拡散方策と分布型クリティックを融合した強化学習
拡散モデルベースの方策を安定してオンライン学習させるため、分布型RLとクリップ付き二重Q学習を組み合わせた頑健なクリティックを提案し、多数の難タスクで最高性能を達成した。
原題: D2 Actor Critic: Diffusion Actor Meets Distributional Critic / Lunjun Zhang, Shuo Han, Hanrui Lyu 他
日本語で読む → - 論文部分観測強化学習機械学習
蒸留か決定か?部分観測強化学習におけるアルゴリズム的トレードオフの理解
部分観測強化学習において、特権的な潜在状態情報を用いた専門家蒸留と標準的な強化学習の間のトレードオフを理論モデルと実験で調査し、潜在ダイナミクスの確率性が選択に影響することを示した。
原題: To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning / Yuda Song, Dhruv Rohatgi, Aarti Singh 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
人間のデモンストレーション不要の軌道スコアラーによるエンドツーエンド自動運転
人間のデモンストレーションを一切使わず、実世界画像とルールベース報酬のみで学習する強化学習ベースのエンドツーエンド自動運転計画手法ZTRSを提案し、長尾シナリオで模倣学習を上回る性能を示した。
原題: Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer / Zhenxin Li, Nadine Chang, Wenhao Yao 他
日本語で読む → - 論文強化学習/ニューロモルフィックAI
スパイキングニューラルネットワークの逐次強化学習のための適応的サロゲート勾配
スパイキングニューラルネットワークの強化学習において、サロゲート勾配の傾きを適応的に調整し、特権ガイドポリシーで学習をブートストラップする手法を提案。実世界のドローン位置制御で性能を2.1倍改善した。
原題: Adaptive Surrogate Gradients for Sequential Reinforcement Learning in Spiking Neural Networks / Korneel Van den Berghe, Stein Stroobants, Vijay Janapa Reddi 他
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
這い方を学ぶ:ソフトロボットの適応移動のための潜在モデルベース強化学習
機体センサーから推定した潜在ダイナミクスを予測モデルとして強化学習に組み込み、ソフトロボットがノイズの多いセンサー情報だけから移動方策を獲得できることをシミュレーションで示した。
原題: Learning to Crawl: Latent Model-Based Reinforcement Learning for Soft Robotic Adaptive Locomotion / Vaughn Gzenda, Robin Chhabra
日本語で読む → - 論文モデルベース強化学習ロボティクス
オンライン最適化によるロボット制御のための効率的なモデルベース強化学習
実世界のロボット制御に向けて、オンラインで動力学モデルを学習し政策更新を行うモデルベース強化学習を提案。油圧ショベルとソフトロボットアームで高いサンプル効率と適応性を示した。
原題: Efficient Model-Based Reinforcement Learning for Robot Control via Online Optimization / Fang Nan, Hao Ma, Qinghua Guan 他
日本語で読む → - 論文安全強化学習ロボティクス
適応的行動スケーリングによる制約認識型強化学習
予測される制約違反に応じてエージェントの行動を滑らかにスケーリングするモジュール型調整器を提案し、SACやTD3と組み合わせて安全性と性能を両立させた。
原題: Constraint-Aware Reinforcement Learning via Adaptive Action Scaling / Murad Dawood, Usama Ahmed Siddiquie, Shahram Khorshidi 他
日本語で読む → - 論文モデルベース強化学習機械学習
適応的事前分布を用いた計画学習のためのKL正則化フレームワーク
MPPIベースのモデルベース強化学習手法をKL正則化の枠組みで統一的に整理し、プランナの行動分布を事前分布として取り込むPO-MPCを提案した論文。
原題: A KL-regularization Framework for Learning to Plan with Adaptive Priors / Álvaro Serra-Gomez, Daniel Jarne Ornia, Dhruva Tirumala 他
日本語で読む → - 論文模倣学習/オフライン強化学習ロボティクス
非専門家データを活用したオフライン強化学習による模倣学習のロバスト化
非専門家データ(プレイデータや不完全なデモ)をオフライン強化学習で活用し、模倣学習ポリシーの回復性と汎化性能を高める手法を提案。
原題: Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning / Kevin Huang, Rosario Scalise, Cleah Winston 他
日本語で読む → - 論文ゼロショット強化学習機械学習
TD-JEPA:ゼロショット強化学習のための潜在予測表現
時間差分学習を用いて長期潜在ダイナミクスを予測する表現をオフライン・報酬なし遷移から学習し、テスト時に任意の報酬関数をゼロショット最適化できる強化学習手法を提案。
原題: TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning / Marco Bagatella, Matteo Pirotta, Ahmed Touati 他
日本語で読む → - 論文制御/強化学習ロボティクス
実環境のケーブル駆動パラレルロボットにおけるロバスト制御システムの評価
ケーブル駆動パラレルロボットの制御において、古典的なPID制御と強化学習(DDPG, PPO, TRPO)を比較し、TRPOが最も低いRMS誤差とロバスト性を示すことを明らかにした。
原題: Evaluation of a Robust Control System in Real-World Cable-Driven Parallel Robots / Damir Nurtdinov, Aliaksei Korshuk, Alexei Kornaev 他
日本語で読む → - 論文強化学習/ロバスト制御ロボティクス
オフラインからオンライン強化学習における敵対的ファインチューニングによるロバストなロボット制御
オフライン強化学習で学習した方策に、実行時の行動に摂動を加える敵対的ファインチューニングを施し、アクチュエータ故障などの外乱に対するロバスト性を向上させる手法を提案。性能に応じたカリキュラムで摂動確率を調整し、安定性とロバスト性のバランスを取る。
原題: Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control / Shingo Ayabe, Hiroshi Kera, Kazuhiko Kawamoto
日本語で読む →