論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
観測に基づく自己予測強化学習による視覚連続制御
視覚ベースの連続制御タスクにおいて、潜在空間での自己予測と観測空間での予測を組み合わせた新しい表現学習手法を提案し、サンプル効率を向上させた。
原題: Observation-Grounded Self-Predictive Reinforcement Learning for Visual Continuous Control / Xinwei Liu, Junyuan Liang, Jianting Zhang 他
日本語で読む → - 論文外骨格/強化学習ロボティクス
股関節外骨格のための段階的マルチエージェント訓練(SMAT):シミュレーション訓練された共適応コントローラの代謝・生体力学的検証
シミュレーションのみで訓練した股関節外骨格の制御ポリシーを実機で検証し、受動時と比較して代謝コストを19.7%削減することを実証した論文。
原題: Staged Multi-Agent Training (SMAT) for Hip Exoskeletons: Metabolic and Biomechanical Validation of a Simulation-Trained Co-Adaptive Controller / Yifei Yuan, Jakob Wolf, Ghaith Androwis 他
日本語で読む → - 論文階層強化学習AI
ニューロシンボリック推論とインクリメンタル知識によるサンプル効率的な階層強化学習
階層強化学習において、探索中に得た知識をシンボリックな高レベルプランナーに逐次反映させることで、サンプル効率を大幅に向上させる手法を提案した。
原題: Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning / Subrat Prasad Panda, Blaise Genest, Arvind Easwaran
日本語で読む → - 論文強化学習/計画制御
co-safe LTL計画のための厳密なモデルフリーポリシー反復法
有限マルコフ決定過程におけるco-safe線形時相論理目標に対するモデルフリー強化学習法を提案し、割引代理を用いて非一意性を解消し、割引なしのポリシー評価と貪欲改善により最適ポリシーへの収束を保証する。
原題: Exact Model-Free Policy Iteration for Co-safe LTL Planning / Zetong Xuan, Yu Wang
日本語で読む → - 論文強化学習ロボティクス
EvoHIL: 自己進化型報酬とフローマッチングによるポリシー最適化を用いた堅牢な人間参加型強化学習
人間参加型強化学習において、報酬モデル・行動生成・視覚ドメインの3つの限界を同時に適応させる統一フレームワークEvoHILを提案し、照明変化下の6つの操作タスクで性能を向上させた。
原題: EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning / Shuoqin Zhang, Tongtong Cheng, Xiru Gao 他
日本語で読む → - 論文自動運転/強化学習機械学習
Dreamer-SAC: 潜在世界モデルにおけるオフポリシー学習によるサンプル効率的な自動運転
自動運転向けに、世界モデルとソフトアクタークリティックを組み合わせ、潜在空間でオフポリシー学習するフレームワークを提案。短いロールアウトとnステップ目標推定により、少ない実環境インタラクションで高い性能を達成した。
原題: Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving / Jiazhuo Li, Linjiang Cao, Qi Liu 他
日本語で読む → - 論文移動操作/強化学習機械学習
LUCID: 想像上のダイナミクスによる潜在スキル統合制御による長期的ヒューマノイド移動操作
長期的なヒューマノイドの移動操作タスクを解決するため、学習したダイナミクスモデルの想像上のロールアウトを通じて再利用可能なスキルを計画する階層的モデルベース強化学習フレームワークを提案した。
原題: LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation / Cheng Guo, Mingzhe Ni, Angelo Cangelosi 他
日本語で読む → - 論文強化学習/VLAロボティクス
時間的GRPO:視覚言語行動強化学習における軌跡レベルの信用割当を超えて
軌跡全体に同じ報酬を割り当てる従来のGRPOの問題を解決するため、タスクを段階に分割し、同じ段階に到達した軌跡同士を比較して段階ごとの利点を計算する新しい手法を提案した。
原題: Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning / Yao Zhou, Hang Gao, Fengge Wu 他
日本語で読む → - 論文強化学習ロボティクス
最小データでの汎用ロボットポリシーの適応
事前学習済みのロボットポリシーが、1回のデモンストレーションと自律的なオンライン相互作用だけで新しいタスクを学習できるようにする、オフラインからオンラインへの強化学習手法MiDASを提案した。
原題: Adaptation of Generalist Robot Policies with Minimal Data / Shreyas Kowshik, Sreyas Venkataraman, Leo Wang 他
日本語で読む → - 論文制御/強化学習ロボティクス
知識蒸留を用いたエンドツーエンド強化学習によるROVの滑らかな6自由度推力制御と海流への迅速適応
ROVの制御において、海流外乱下でも低定常誤差・高速応答・省エネ・滑らかな推力を同時に実現する統一制御フレームワークとして、2段階蒸留学習によるTSRCA-PPO法を提案し、シミュレーションで従来のP-PIDより優れることを示した。
原題: Knowledge-Distilled End-to-End Reinforcement Learning for Smooth 6-DOF Thrust Control and Rapid Adaptation to Ocean Currents in Remotely Operated Vehicles / Tiankuang Wen, Huiping Li, Gang Liu 他
日本語で読む → - 論文強化学習ロボティクス
アクチュエータレベル方策によるケーブル駆動パラレルロボット構成を横断した深層強化学習の一般化
ケーブル駆動パラレルロボット(CDPR)の制御に、ロボット構成に依存しないアクチュエータレベル方策を導入し、シミュレーションで訓練した方策を実機に転移して汎化性能を実証した。
原題: Generalizing deep reinforcement learning across cable-driven parallel robot configurations with actuator-level policies / Abir Bouaouda, Mohamed Boutayeb, François Charpillet 他
日本語で読む → - 論文VLA/強化学習ロボティクス
新規ロボット形態に対するOpenVLA-OFTのRLブートストラッピング
事前学習済みのVLAポリシーを、デモデータなしでケーブル駆動パラレルロボットに適応させるため、シミュレーション内でPPOとGRPOを用いた強化学習を行い、指示成功率を向上させた。
原題: RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment / Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov
日本語で読む → - 論文強化学習制御
臨界性モデルを用いた身体性AIの自己進化学習
身体性AIのファインチューニング停滞を解決するため、ポリシー自身の実行結果から将来の失敗確率を予測する臨界性モデルを学習し、失敗しやすいシナリオを重点的にサンプリングして学習データの情報密度を高める自己進化手法を提案した。
原題: Self-Evolving Learning for Embodied AI with Criticality Model / Linxuan He, Yuying Tian, Lingxiang Fan 他
日本語で読む → - 論文マルチエージェント強化学習AI
MARS-RA: マルチモーダル比較による具現化マルチエージェント協調におけるクレジット割り当てのためのランク集約
協調マルチエージェント強化学習におけるクレジット割り当て問題を、大規模マルチモーダルモデルによるエージェント間のペア比較を用いたランク集約問題として再定式化し、ノイズや動的なエージェント参加に頑健な報酬整形手法を提案した。
原題: MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation / Dawei Wang, Di Zhao, Xinyuan Liu 他
日本語で読む → - 論文強化学習機械学習
良いランカー、悪い目的関数:表現力豊かな方策探索下での双線形コントラスト批評家
コントラスト学習による批評家は行動のランキングには優れるが、そのスコアを最大化すると価値関数として不適切で、オフサポートの行動を選んでしまうことを示した論文。
原題: Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search / Ayushman Singh, Siddharth Aphale
日本語で読む → - 論文強化学習機械学習
SCOUT: スパース報酬強化学習のための文脈別リセットカリキュラム
スパース報酬強化学習において、各タスク文脈に個別のリセットカリキュラムを適応的に与えるオンライン制御手法SCOUTを提案し、ナビゲーションや操作タスクで学習を改善することを示した。
原題: SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning / Siddharth Aphale, Ayushman Singh
日本語で読む → - 論文強化学習機械学習
階層的アクションチャンキングを用いたオフライン強化学習
オフライン目標条件付き強化学習において、高レベルの潜在プランニングと低レベルのアクションチャンキングを組み合わせたHiQCを提案し、長期的タスクでの価値推定誤差を低減して性能を向上させた。
原題: Offline RL with Hierarchical Action Chunking / Ahad Jawaid
日本語で読む → - 論文強化学習AI
専門家行動事前強化学習
オンライン強化学習のサンプル効率を向上させるため、オフラインデータに依存せず、オンラインリプレイバッファから専門家ポリシー事前分布を生成するQ誘導CVAEを提案し、専門家行動ガイダンスとポリシー勾配補正を統合したアルゴリズムEBPを導入した。
原題: Expert Behavior Prior Reinforcement Learning / Gong Gao, Weidong Zhao, Xianhui Liu 他
日本語で読む → - 論文強化学習AI
環境・エージェント・結合系のワールドモデル
モデルベース強化学習におけるワールドモデルを、予測するチャネル(環境、エージェント、結合系)に基づいて分類し、計算力学を用いて各チャネルの正準モデルを定義した。
原題: World models of environment, agent and joint agent-environment systems / Manuel Baltieri, Filippo Torresan, Yivan Zhang 他
日本語で読む → - 論文遠隔操作/強化学習制御
関節柔軟性と時間変動遅延を有する遠隔操作マニピュレータの制御における適応ゲイン調整のための深層強化学習
関節の柔軟性と時間変動する通信遅延を持つ遠隔操作システムに対し、安定なP+dコントローラとTD3強化学習エージェントを組み合わせ、遠隔側の比例・減衰ゲインをリアルタイム調整して振動低減と追従性能向上を実現した。
原題: Deep Reinforcement Learning for Adaptive Gain Tuning in Control of Teleoperation Manipulators with Joint Flexibility and Time-Varying Delays / Armin Attarzadeh, Mohammad Ali Ghaemifar, Alireza Khanzadeh 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
Dreamer-CPC: 世界モデルを用いたメッセージ学習による分散型マルチエージェント強化学習
分散型マルチエージェント強化学習において、世界モデルの潜在状態からメッセージを生成する手法を提案し、観測が欠落するタスクで既存手法を大きく上回る性能を達成した。
原題: Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning / Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi
日本語で読む → - 論文強化学習機械学習
能動的推論を凸マルコフ決定過程として捉える
能動的推論(AIF)の期待自由エネルギー最小化を、閉ループ制御ポリシーに対して凸マルコフ決定過程(MDP)として定式化し、鏡像降下アルゴリズムを導出した。
原題: Active Inference as a Convex Markov Decision Process / Nikola Milosevic, Nicolás Hinrichs, Nico Scherf
日本語で読む → - 論文強化学習機械学習
関係性を持つ隠れ状態による強化学習における創発的計画行動
モデルフリー強化学習において、環境状態に紐づく関係性を持つ隠れ状態のネットワークが、学習された関係を通じて計画機構を獲得することを示した論文。
原題: Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States / Armin Sommer
日本語で読む → - 論文モデルベース強化学習/安全制御機械学習
世界からのフィードバックから学ぶ:モデルベース強化学習においてモデルの不確実性がリスクシグナルとして機能しない理由
モデルベース強化学習の安全制御において、モデル内部の不確実性をリスク指標として使うと衝突率が悪化することを示し、センサー由来のマージンや衝突ラベルから学習したフィードバックモデルなど、世界からのフィードバック信号を用いることで衝突率を大幅に低減できることを実証した論文。
原題: Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL / Zhaohui Wang
日本語で読む → - 論文世界モデル/強化学習画像認識
PAVXploreRL: 行動探索を伴う物理・行動・視覚の世界モデル強化学習
事前学習済みの潜在世界モデルに強化学習を適用し、物理的妥当性・行動追従性・視覚的忠実性を明示的に最適化することで、専門家データ外の行動への汎化を改善する手法を提案した。
原題: PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration / Han Wang, Zijun Wang, Shuoshuo Xue 他
日本語で読む → - 論文強化学習機械学習
DAGR: 状態条件付き目標表現と差分認識型目標クロスアテンション
目標条件付き強化学習において、現在の状態を考慮しない従来の目標表現を、マルチスケールのゲート付きクロスアテンションで状態条件付きに改良する手法DAGRを提案した。ナビゲーションタスクで性能が向上するが、操作やパズルではベースラインと同等以下であり、普遍的な改善ではないことを示した。
原題: DAGR: State-Conditioned Goal Representations via Difference-Aware Goal Cross-Attention / Xing Lei, Wenyan Yang, Xuetao Zhang 他
日本語で読む → - 論文強化学習/表現学習機械学習
強化学習のための因子分解スペクトル表現
遷移カーネルを3モードテンソルとみなし、CP分解とノイズ対比学習で状態・行動・次状態のエンコーダを学習する手法FaStRを提案。表現学習に必要なサンプル数を削減し、高次元の移動タスクで効果を発揮する。
原題: Factorized Spectral Representations for Reinforcement Learning / Junyi Wu, Dan Li
日本語で読む → - 論文強化学習AI
人間の選好と正当化に基づくワールドモデルを用いた安全なエージェント行動の学習
未知の環境で報酬関数が使えない安全重視のタスクに対し、人間の選好とその理由(正当化)を活用して報酬モデルを学習し、ワールドモデルとモデル予測制御で安全な方策を直接展開する手法DROPJを提案した。
原題: Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models / Ilias Kazantzidis, Timothy J. Norman, Yali Du 他
日本語で読む → - 論文VLA/強化学習機械学習
少ないデータから多くを学ぶ:後知恵からの強化学習
VLAモデルの強化学習後訓練において、失敗したロールアウトを実際に達成したタスクに再ラベル付けする「後知恵からの学習」を提案し、サンプル効率を5倍向上させた。
原題: Learning More from Less: Reinforcement Learning from Hindsight / Iris Xu, Sunshine Jiang, John Marangola 他
日本語で読む → - 論文強化学習/探索機械学習
プロンプト駆動探索
ロボット操作や推論タスクにおいて、報酬が得られない初期状態からでも、視覚言語モデルがロールアウト動画を分析してプロンプトを書き換えることで探索を促進し、強化学習の成功を可能にする手法を提案した。
原題: Prompt-Driven Exploration / Sunshine Jiang, John Marangola, David Zhang 他
日本語で読む →