論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文跳躍/強化学習ロボティクス
SRL: SLIPモデルと強化学習の統合による俊敏なロボット跳躍
SLIPモデルの物理的基盤と強化学習の適応性を組み合わせたハイブリッド制御フレームワークSRLを提案し、二足・四足ロボットの跳躍を安定化・高速学習する手法を実証した。
原題: SRL: Combining SLIP Model and Reinforcement Learning for Agile Robotic Jumping / Xiaowen Hu, Linqi Ye, Yudi Zhu 他
日本語で読む → - 論文強化学習ロボティクス
効果的なポリシー平滑化のための正則化の再設計
強化学習におけるポリシー関数の平滑化を効果的に行うため、既存の正則化手法の問題点を特定し、改良した正則化を提案する論文。複数のタスクとアルゴリズムで性能向上と滑らかな動作を実現し、四足ロボットのsim-to-real学習で目標速度の急変に対する頑健性を示した。
原題: Redesigning Regularization for Effective Policy Smoothing / Taisuke Kobayashi, Naoto Yamanaka
日本語で読む → - 論文模倣学習/逆強化学習機械学習
学習報酬を用いた大規模行動モデルのコヒーレントなオフポリシー改善
大規模な事前学習済みロボット操作ポリシーを、逆強化学習で学習した稠密報酬を用いて微調整し、スパース報酬のRLベースラインよりも高い成功率を達成した。
原題: Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards / Christian Scherer, Joe Watson, Theo Gruner 他
日本語で読む → - 論文マルチエージェント強化学習機械学習
個別制御バリア関数ガイド拡散モデルによる安全なオフラインマルチエージェント強化学習
オフライン強化学習に拡散モデルを用い、個別の制御バリア関数を組み込むことで、マルチエージェント環境での安全な軌道生成を実現する新しいアルゴリズムを提案した。
原題: Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning / Qingyun Guo, Junyi Shi, Jianuo Huang 他
日本語で読む → - 論文ロコモーション/強化学習ロボティクス
RoboNaldo: 動作誘導カリキュラム強化学習による正確で安定かつ強力なヒューマノイドサッカーシュート
人間のキック動作を参照として段階的に最適化する3段階カリキュラム強化学習フレームワークを提案し、ヒューマノイドロボットによる高インパルスで正確なサッカーシュートを実現した。
原題: RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning / Yichao Zhong, Yidan Lu, Yuhang Lu 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
自動運転の高速道路走行のための安全強化学習:安全性と効率性を両立する統合フレームワーク
高速道路自動運転向けに、安全距離・報酬機械・混合専門家を統合した安全強化学習フレームワークを提案し、CARLAシミュレーションで安全性と効率性の向上を実証した。
原題: Safe Reinforcement Learning of Autonomous Highway Driving: A Unified Framework for Safety and Efficiency / Chufei Yan, Zhihao Cui, Yiyan Lv 他
日本語で読む → - 論文強化学習/ヒューマノイドロボティクス
批評家アーキテクチャの重要性:ヒューマノイドの移動操作における二重批評家と統一批評家の比較
ヒューマノイドロボットの移動と操作を統合する強化学習において、単一の統一批評家と分離した二重批評家のどちらが有効かをUnitree G1で比較し、二重批評家が学習効率と成功率で優れることを示した。
原題: Critic Architecture Matters: Dual vs. Unified Critics for Humanoid Loco-Manipulation / Mehmet Turan Yardımcı
日本語で読む → - 論文強化学習/適応ロボティクス
動力学は教えられるものではなく学習されるもの:潜在動力学幾何の半教師あり発見によるゼロショット方針適応
ロボット強化学習において、環境の動力学変化に頑健に適応するため、物理パラメータを明示せずに相互作用の結果から潜在空間の幾何構造を学習する手法を提案し、MuJoCoベンチマークで既存手法を上回る性能を示した。
原題: Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation / Zhiming Xu, Weitao Zhou, Xianghui Pan 他
日本語で読む → - 論文強化学習/医療ロボティクスロボティクス
RobOralScan: ロボットによる歯科再構成のための能動的口腔内スキャン学習
強化学習を用いて、ロボットが自動で口腔内をスキャンし、歯の3次元再構成を行う初のパイプラインを提案した論文。
原題: RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction / Jinhyung Lee, Haeun Yun, Siwon Kim 他
日本語で読む → - 論文VLA/強化学習機械学習
ROAD-VLA: 自己蒸留による視覚言語行動モデルのロバストなオンライン適応
ロボット操作のための視覚言語行動モデル(VLA)のオンライン適応を強化するため、行動空間で近位教師を構築する自己蒸留フレームワークを提案。スパースな報酬を密なトークンレベルの信号に変換し、PPOを上回る性能を示した。
原題: ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models / Kejing Wang, Toan Nguyen, Minh Hoang Nguyen 他
日本語で読む → - 論文強化学習機械学習
SHAPO: シャープネスを考慮した安全探索のための方策最適化
エピステミック不確実性に基づく安全探索手法を提案し、パラメータ摂動に対する感度を利用して方策更新を悲観的にすることで、未探索領域での安全な行動を促進する。
原題: SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration / Kaustubh Mani, Yann Pequignot, Vincent Mai 他
日本語で読む → - 論文強化学習ロボティクス
ビデオ基盤の最適輸送によるフィードバック効率的なオフライン選好ベース強化学習
ビデオ基盤モデルの表現空間で最適輸送を用いて軌道を整列させ、少数のラベルから高品質な擬似ラベルを生成することで、選好ベース強化学習のラベルコストを大幅に削減する半教師ありフレームワークを提案した。
原題: Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning / Tung M. Luu, Hwanhee Kim, Younghwan Lee 他
日本語で読む → - 論文強化学習/自動化ロボティクス
HARBOR: エージェント型ロボット強化学習のためのハーネスフレームワーク
ロボット強化学習のパイプラインを自動化するエージェントフレームワークを提案し、環境構築からポリシー訓練までを自動化して、複数のベンチマークで有効性を示した。
原題: HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning / Zechu Li, Yufeng Jin, Xiaoyang Liu 他
日本語で読む → - 論文強化学習/計画ロボティクス
回復・発見・計画:ロボットの失敗からスキルと概念を学習する
ロボットが失敗から回復するだけでなく、将来の失敗を避けるための抽象的な知識を獲得する手法を提案。強化学習で回復スキルを学び、その経験から関係述語を発見して抽象計画に活用する。
原題: Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures / Bowen Li, Mayank Mishra, Y. Isabel Liu 他
日本語で読む → - 論文強化学習/生成的ポリシー機械学習
ラグランジアン摂動拡散ステアリング:生成的ポリシーのための潜在強化学習
凍結した生成的ポリシーに対し、ノイズ空間の小さな摂動を学習して性能を改善する軽量適応手法LP-DSを提案。ロボット操作や移動、器用操作のベンチマークで成功率と報酬を向上させた。
原題: Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies / Hikmet Simsir, Ozgur S. Oguz
日本語で読む → - 論文モデルベース強化学習機械学習
すべてのモデルは誤り、どこが誤りかを知ることが有用:強化学習におけるモデル不確実性について
モデルベース強化学習におけるモデルの不正確さを扱う枠組みを提案し、不確実性を適切に扱うことでモデルの悪用を防ぎ、ハードウェア上での直接学習や安全な探索の成功を示した。
原題: All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning / Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele 他
日本語で読む → - 論文オフライン強化学習機械学習
行動不変なタスク表現学習とTransformer基盤の世界モデルによるオフラインメタ強化学習
オフラインメタ強化学習におけるコンテキストとポリシーの分布シフト問題を解決するため、情報理論に基づくタスク表現学習とTransformer型確率的世界モデルを統合したフレームワークを提案した。
原題: Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning / Fuyuan Qian, Menglong Zhang, Song Wang 他
日本語で読む → - 論文強化学習機械学習
生存強化学習:スケーラブルな自己教師ありRLに向けて
自己教師ありの対比強化学習の限界を克服するため、目標状態での滞在時間を最大化する分類ベースの生存価値学習フレームワークを提案し、長期的な移動タスクで既存手法を2〜8倍上回る性能を達成した。
原題: Survival Reinforcement Learning: Toward Scalable Self-Supervised RL / Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard 他
日本語で読む → - 論文マルチエージェント強化学習cs.MA
他者の夢を見る:マルチエージェント強化学習における世界モデル内の潜在チームメイトモデリング
協調型マルチエージェント強化学習において、チームメイトの内部方策や意図を世界モデル内で潜在変数としてモデル化し、心の理論ヘッドで推論することで、多様な協調相手への適応を可能にするアーキテクチャを提案した。
原題: Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning / Tomas Leroy-Stone
日本語で読む → - 論文強化学習機械学習
マックスミン基準を用いた制約付き多目的強化学習
複数の目的を公平に扱うマックスミン基準と明示的な制約充足を統合した多目的強化学習フレームワークを提案し、理論的基盤と収束解析、さらに建物熱制御や移動制御、交通管理などのシミュレーションで有効性を示した。
原題: Constrained Multi-Objective Reinforcement Learning with Max-Min Criterion / Giseung Park, Hyunyoung Nam, Woohyeon Byeon 他
日本語で読む → - 論文マルチエージェント強化学習AI
微分可能な信念に基づく対戦相手形成
対戦相手の信念を状態として捉え、その信念更新を微分可能な形でモデル化することで、報酬構造から最適な戦略を自動的に学習する新しい対戦相手形成手法を提案した。
原題: Differentiable Belief-based Opponent Shaping / Aarav G Sane, Karthik Sivachandran, Rohan Paleja
日本語で読む → - 論文強化学習機械学習
LLM報酬設計が失敗するとき:スパース構造化RLのための診断駆動型改良
スパースで構造化された強化学習タスクにおいて、LLMによる報酬整形を一回生成ではなくデバッグとして捉え、訓練診断と失敗モード分類に基づく反復改良を提案し、DoorKey-8x8やKeyCorridorの成功率を大幅に向上させた。
原題: When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL / Youting Wang, Yuan Tang, Bowen Liu 他
日本語で読む → - 論文逆強化学習機械学習
確率的リカレント意図切替モデル
逆強化学習において、エピソード内の目標切替を捉えるため、リカレントネットワークで観測履歴から意図分布を推定する新しいモデルを提案し、EMアルゴリズムが閉形式で解けることを示した。ロボット操作データを含む複数環境で評価し、高い尤度と解釈可能な意図抽出を実現した。
原題: Probabilistic Recurrent Intention Switching Model / Wenyuan Sheng, Hao Zhu, Joschka Boedecker
日本語で読む → - 論文強化学習機械学習
拡散ポリシー最適化による世界モデル強化学習のスケーリング
世界モデルを用いた強化学習において、探索と価値学習の構造的不整合がスケーリングのボトルネックであることを特定し、拡散ポリシー表現で統一するMBDPOを提案した。
原題: Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization / Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu 他
日本語で読む → - 論文強化学習機械学習
スコアベース一段階MeanFlow方策最適化
強化学習における拡散・フローマッチング方策の多段階推論コストを削減するため、Q関数からスコア推定と確率フローODEで目標速度場を構築し、一段階生成で高価値モードに集中させる新しいアクタークリティック法SOMを提案した。
原題: Score-Based One-step MeanFlow Policy Optimization / Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn 他
日本語で読む → - 論文モデルベース強化学習機械学習
勾配ペナルティ付き潜在ダイナミクスによる滑らかでサンプル効率的な夢の学習
モデルベース強化学習のDreamerV3に、潜在遷移ダイナミクスの局所的な滑らかさを促す勾配ペナルティ正則化を追加し、サンプル効率を向上させた。
原題: Dreaming Smoothly and Sample Efficiently with Gradient Penalized Latent Dynamics / Romil V. Sonigra, P. R. Kumar
日本語で読む → - 論文階層強化学習機械学習
階層的組合せ計画のためのマルチタイムスケール抽象化の学習
確率的組合せ最適化問題に対して、可変時間の意思決定を扱うSMDP対応の世界モデルと潜在空間ツリー探索を組み合わせたモデルベース階層強化学習手法を提案し、ベンチマークで優位性を示した。
原題: Learning Multi-Timescale Abstractions for Hierarchical Combinatorial Planning / Vivienne Huiling Wang, Tinghuai Wang, Joni Pajarinen
日本語で読む → - 論文強化学習AI
不完全な世界モデルは悪用可能である
強化学習における世界モデルの悪用可能性を定義し、報酬ハッキングとの理論的関係を明らかにした論文。
原題: Imperfect World Models are Exploitable / Logan Mondal Bhamidipaty, Esmeralda S. Whitammer, David Abel 他
日本語で読む → - 論文強化学習機械学習
JEDI: オンライン強化学習のための統合埋め込み拡散世界モデル
拡散世界モデルをオンライン強化学習に適用し、JEPAフレームワークを用いて潜在空間を拡散ノイズ除去損失から直接学習する新しい手法を提案。再構成や事前学習モデルに頼らず、将来の潜在表現を予測することで、効率性と性能を両立する。
原題: JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning / Jing Yu Lim, Rushi Shah, Zarif Ikram 他
日本語で読む → - 論文マルチエージェント強化学習制御
部分モジュラーマルチエージェントポリシー学習によるオープンマルチエージェントシステムにおけるオンライン分散タスク割り当て
本論文は、部分モジュラーなチーム効用を持つマルチエージェント強化学習を用いて、オンライン分散タスク割り当て問題を解決する。カテゴリカルポリシーと整合する新しい連続緩和法(PME)を導入し、SubMAPGという集中学習・分散実行のポリシー勾配法を提案する。
原題: Submodular Multi-Agent Policy Learning for Online Distributed Task Allocation in Open Multi-Agent Systems / Jing Liu, Yangyang Yang, Luca Ballotta 他
日本語で読む →