論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/20 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/強化学習AI
EXIMO: VLMによるVLAポリシー探索のガイド
VLAポリシーの効率的なファインチューニング手法EXIMOを提案。VLMをプランナーとして使い、長期的なタスクを分解してデータ収集し、模倣学習とオフポリシーRLで最適化する。
原題: EXIMO: VLM Guided Exploration of VLA Policies / Bhavya Sukhija, Oliver Groth, Mohit Shridhar 他
日本語で読む → - 論文強化学習AI
階層的スキルポリシーの学習:オフライン品質多様性強化学習によるアプローチ
事前収集データから多様で高品質なスキルを抽出し、オンライン学習を強化する統合パイプラインQDOSを提案。アドバンテージ重み付き品質多様性事前学習とデータ再利用戦略により、操作タスクで優れた性能を達成。
原題: Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning / Tanachai Anakewat, Takayuki Osa, Tatsuya Harada
日本語で読む → - 論文階層型強化学習/四足歩行ロボティクス
狭い空間を跳び越える四足ロボットの高ダイナミックスキル遷移学習
四足ロボットが狭いゲートを動的に通過するための階層型強化学習パイプラインを提案。低レベル方策は模倣学習で動物の多様なスキルを獲得し、高レベル制御が視覚情報とスキル能力を考慮して衝突回避軌道を選択する。
原題: Learning Highly Dynamic Skills Transition for Quadruped Jumping Through Constrained Space / Zeren Luo, Jiahui Zhang, Yimin Han 他
日本語で読む → - 論文オフライン強化学習画像認識
RoMAN-Flow: ロボット操作におけるオフライン強化学習のための自己回帰正規化フローの制御
自己回帰正規化フローを用いたオフライン強化学習フレームワークを提案し、サンプリング不要の尤度目的と一段階蒸留により推論遅延を削減しつつ、ロボット操作の性能を維持する。
原題: RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation / Shaoxuan Wang, Guangting Zheng, Rui Huang 他
日本語で読む → - 論文強化学習/器用操作/sim2realロボティクス
ADEPT: 事前学習と強化学習による事後学習で器用さを加速する
高自由度ロボットの器用な操作を、事前学習と事後学習を組み合わせた強化学習フレームワークで実現し、シミュレーションから実機への転移を可能にした。
原題: ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning / Jayjun Lee, Jessica Yin, Asif Rana 他
日本語で読む → - 論文モデルベース強化学習AI
ニューロシンボリック世界モデルによるゼロショットタスク転送に向けて
報酬予測を潜在状態のシンボリックな部分に依存させる新しい世界モデルを提案し、同じシンボリック状態空間上の新しい報酬関数へ環境相互作用なしで適応できることを示した。
原題: Towards Zero-Shot Task Transfer with Neurosymbolic World Models / Isidoro Tamassia, Lennert De Smet, Giuseppe Marra
日本語で読む → - 論文強化学習機械学習
反復による強化:強化学習における即時エピソード反復によるサンプル効率の向上
成功したエピソードの行動系列を即座に繰り返す新しいメカニズム「Instant Episode Repetition (IER)」を提案し、SACやTD3に統合してサンプル効率を向上させた。
原題: Repetition as Reinforcement: Enhancing Sample Efficiency via Instant Episode Repetition in Reinforcement Learning / Hoda Yamani, Yuning Xing, Koen van Rijnsoever 他
日本語で読む → - 論文自動運転/倫理/強化学習機械学習
倫理的判断ヘッド:人間のフィードバックからの強化学習による自動運転車の規範倫理の実装
自動運転車の倫理的判断を強化学習で実装するフレームワークを提案し、功利主義とカント主義の二つの規範を評価した。人間の好みに基づく報酬モデルを用いて訓練し、倫理フレームワークの学習可能性の非対称性を明らかにした。
原題: The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback / Thomas Mbrice, Ammar Ali, Sami Mian 他
日本語で読む → - 論文強化学習機械学習
世界モデルを用いたQ学習
Q学習に世界モデルを組み合わせ、実データのみで学習しつつ想像上の軌道で探索を行うことで、サンプル効率と性能を向上させる手法を提案した。
原題: Q-Learning With World Models / Perry Dong, Yueru Jia, Chelsea Finn 他
日本語で読む → - 論文強化学習/ベンチマークAI
クロノクックド:強化学習エージェントにおける暗黙の区間タイミングのベンチマーク
調理シナリオを通じて、強化学習エージェントの時間知覚能力を評価するベンチマークスイートを提案し、時間情報が明示されない環境での性能を検証する。
原題: Chronocooked: A Benchmark for Implicit Interval Timing in Reinforcement Learning Agents / Amrapali Pednekar, Alvaro Garrido-Perez, Yara Khaluf 他
日本語で読む → - 論文ヒューマノイド/VLA/強化学習ロボティクス
HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
原題: HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL / Langzhe Gu, Chengkai Hou, Meng Li 他
日本語で読む → - 論文強化学習/ヒューマノイドロボティクス
RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
原題: RoboStriker: Latent-Space Strategic Games for Autonomous Humanoid Boxing / Kangning Yin, Kaige Liu, Zhe Cao 他
日本語で読む → - 論文強化学習ロボティクス
時間論理に基づく普遍的なタスク表現による強化学習
LTL式からタスクの意味を抽出する新しい表現アーキテクチャを提案し、任意の強化学習アルゴリズムに統合可能な普遍的なタスク表現フレームワークLOTUSを導入した。双模倣距離による理論的保証で、学習効率と汎化性能を大幅に向上させる。
原題: Temporal Logic Guided Universal Task Representations for Reinforcement Learning / Hao Zhang, Zhangli Zhou, Zhen Kan
日本語で読む → - 論文介入学習/強化学習ロボティクス
GAINS: 強化学習における不整合な人間介入信号の活用
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
原題: GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning / Xinyi Zhang, Yinuo Zhao, Pei Ren 他
日本語で読む → - 論文強化学習ロボティクス
Max-Q選択的模倣による人間参加型オンラインロボット学習
人間の介入を活用したオンライン強化学習において、介入軌道を直接評価するMC Q-chunk批判と、現在のポリシーとバッファサンプルのうち高いQ値を持つ方を模倣するmax-Q選択的模倣を組み合わせ、介入学習と自己改善を自動的に切り替える手法を提案した。実機のUSB挿入タスクで99%の成功率を30分で達成した。
原題: Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning / Zihang Wang, Yishan Wang
日本語で読む → - 論文VLA/強化学習ロボティクス
StructRL: フローベースVLAのための構造化アクション空間探索
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
原題: StructRL: Structured Action-Space Exploration for Flow-Based VLAs / Jiarui Yang, Bin Zhu, Jingjing Chen 他
日本語で読む → - 論文強化学習/UAVロボティクス
AgilePE: 自己対戦強化学習による自律UAV追跡・回避
自己対戦強化学習を用いて、UAVの追跡・回避行動をエンドツーエンドで学習し、シミュレーションから実機へのゼロショット転送を実現したシステムを提案する。
原題: AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning / Wenhao Tang, Tianyang Chen, Zhejun Cui 他
日本語で読む → - 論文強化学習/時相論理AI
信号時相論理のための報酬機械
信号時相論理(STL)仕様を強化学習で満たすための、オートマトンに基づく効率的な記憶機構とマルコフ報酬を導入し、既存のロバスト性報酬より高い満足率とロバスト性を達成した。
原題: Reward Machines for Signal Temporal Logic / Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai
日本語で読む → - 論文強化学習機械学習
世界モデルによる自動研究エージェントのスケーリング
自動研究エージェントの強化学習において、環境実行がボトルネックになる問題を解決するため、世界モデルで環境を置き換えるWMRLを提案し、バイアス補正とノイズ抑制で性能を向上させた。
原題: Scaling Automatic Research Agents via World Models / Xiyuan Yang, Sheikh Sarwar, Jingru Cheng 他
日本語で読む → - 論文計画/強化学習AI
多様な計画ポリシーの発見:品質多様性最適化によるマルチモーダル具現化エージェント
マルチモーダル具現化エージェントのための多様な計画ポリシーを品質多様性最適化で発見し、行き詰まり時に別のポリシーへ切り替えることでタスク成功率を向上させる。
原題: Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization / Pengfei Xu, Yong Liu, Xiaoya Nan 他
日本語で読む → - 論文3Dシーン生成/強化学習AI
iARCS: 反復エージェント強化学習による制御可能な3Dシーン生成
事前学習済みの3Dシーン生成器を自然言語のタスク要件に適応させる反復エージェント強化学習フレームワークを提案。物理的妥当性とレイアウト品質を向上させつつ、タスク固有の制約(歩行可能性、到達可能性、クリアランス)を満たすシーンを生成する。
原題: iARCS: Iterative Agentic RL for Controllable 3D Scene Generation / Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel 他
日本語で読む → - 論文ワールドモデル/強化学習AI
WorldCycle: 長期的ビデオワールドモデルのための自己検証型強化学習
可逆なアクションサイクルを用いて、長期的な正確性を検証する自己教師あり強化学習フレームワークを提案し、ワールドモデルのドリフトを大幅に低減した。
原題: WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models / Bohai Gu, Yueyang Yuan, Taiyi Wu 他
日本語で読む → - 論文強化学習機械学習
報酬構造が強化学習におけるエピソード探索と神経記憶の相互作用を形成する
部分観測強化学習において、探索ボーナスと記憶アーキテクチャの相互作用を制御された環境で調査し、報酬の構造(密度ではなく)がその相互作用パターンを決定することを示した。
原題: Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning / Jai Malegaonkar, Rohan Patil, Henrik I. Christensen
日本語で読む → - 論文強化学習/PbRL機械学習
SP3O: 報酬モデリングなしでセグメント選好から強化学習する手法
報酬モデルを使わずに、セグメント単位の選好フィードバックから方策を直接学習する新しい勾配ベースのPbRLアルゴリズムSP3Oを提案した。理論的解析とロボット制御・LLM微調整での実験で、特に長期的タスクでの性能向上を示した。
原題: SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling / Evan Assmus, Qining Zhang, Lei Ying
日本語で読む → - 論文強化学習/制御理論機械学習
強化学習と制御理論の基礎:接点と新たな視点
強化学習と適応制御の違いを解説し、両者を組み合わせたデータ駆動型意思決定を古典的な移動制御問題で実証するチュートリアル。
原題: Foundations of Reinforcement Learning and Control:Connections and New Perspectives / Claire Vernade, Onno Eberhard, Martha White 他
日本語で読む → - 論文強化学習機械学習
上側期待値マルチステップQ学習によるオフ方策強化学習
マルチステップリターンの悲観的バイアスを非対称な期待値損失で補正する新しいQ学習アルゴリズムENQを提案し、理論的性質と実験性能を示した。
原題: Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning / Abdelghani Ghanem, Mounir Ghogho
日本語で読む → - 論文外骨格/強化学習ロボティクス
股関節外骨格のための段階的マルチエージェント訓練(SMAT):シミュレーション訓練された共適応コントローラの代謝・生体力学的検証
シミュレーションのみで訓練した股関節外骨格の制御ポリシーを実機で検証し、受動時と比較して代謝コストを19.7%削減することを実証した論文。
原題: Staged Multi-Agent Training (SMAT) for Hip Exoskeletons: Metabolic and Biomechanical Validation of a Simulation-Trained Co-Adaptive Controller / Yifei Yuan, Jakob Wolf, Ghaith Androwis 他
日本語で読む → - 論文強化学習機械学習
観測に基づく自己予測強化学習による視覚連続制御
視覚ベースの連続制御タスクにおいて、潜在空間での自己予測と観測空間での予測を組み合わせた新しい表現学習手法を提案し、サンプル効率を向上させた。
原題: Observation-Grounded Self-Predictive Reinforcement Learning for Visual Continuous Control / Xinwei Liu, Junyuan Liang, Jianting Zhang 他
日本語で読む → - 論文強化学習/計画制御
co-safe LTL計画のための厳密なモデルフリーポリシー反復法
有限マルコフ決定過程におけるco-safe線形時相論理目標に対するモデルフリー強化学習法を提案し、割引代理を用いて非一意性を解消し、割引なしのポリシー評価と貪欲改善により最適ポリシーへの収束を保証する。
原題: Exact Model-Free Policy Iteration for Co-safe LTL Planning / Zetong Xuan, Yu Wang
日本語で読む → - 論文制御/強化学習ロボティクス
知識蒸留を用いたエンドツーエンド強化学習によるROVの滑らかな6自由度推力制御と海流への迅速適応
ROVの制御において、海流外乱下でも低定常誤差・高速応答・省エネ・滑らかな推力を同時に実現する統一制御フレームワークとして、2段階蒸留学習によるTSRCA-PPO法を提案し、シミュレーションで従来のP-PIDより優れることを示した。
原題: Knowledge-Distilled End-to-End Reinforcement Learning for Smooth 6-DOF Thrust Control and Rapid Adaptation to Ocean Currents in Remotely Operated Vehicles / Tiankuang Wen, Huiping Li, Gang Liu 他
日本語で読む →