論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/8 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
強化学習エージェントにおける障害様表現型のトランス診断空間
強化学習エージェントに認知評価信号を操作して7つの心理障害(不安、躁病、強迫性チェック、うつ、衝動性、依存症、PTSD)を誘発し、用量反応関係や障害間の相互作用を分析した研究。
原題: A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents / Hari Prasad
日本語で読む → - 論文強化学習AI
拡散ガイドによる不確実性を考慮した遅延ポリシー最適化
強化学習における遅延フィードバックによる性能劣化を解決するため、拡散モデルで遅延状態と現在状態の関係をモデル化し、その不確実性を重み付けに利用する新しい手法を提案した。
原題: Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization / Junqi Tu, Zejiao Liu, Fangfei Li 他
日本語で読む → - 論文VLA/強化学習機械学習
大規模視覚言語行動モデルにおける効率的かつ汎用的な強化学習のためのオフライン教師信号の活用
オフライン教師信号を強化学習に組み込むことで、OOD性能を保ちつつ学習効率を約2倍に向上させるハイブリッド手法を提案・評価した。
原題: Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models / Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov
日本語で読む → - 論文世界モデル/強化学習機械学習
エージェント探索と構造化モデリングの相乗効果によるタスク十分な世界モデルの学習
エージェントが環境を能動的に探索してタスク関連情報を収集し、そのデータからタスクに必要な最小限の表現を世界モデルで学習することで、サンプル効率と汎化性能を向上させる手法を提案した。
原題: Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling / Fan Feng, Yujia Zheng, Minghao Fu 他
日本語で読む → - 論文VLA/強化学習AI
VLA Grounder: ブラックボックスVLAモデルのための言語条件付け空間最適化
凍結されたVLAモデルの動作を改善するため、人間の指示をVLAに適したコマンドへ変換する言語条件付け空間ポリシーを強化学習で最適化する手法を提案。
原題: VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models / Damir Shodiev, Aleksei Staroverov, Nikita Kachaev 他
日本語で読む → - 論文コード生成/強化学習機械学習
DecompRL: モジュール型コード生成の学習による難問解決
LLMが解けない問題を、問題を小さなモジュールに分解して再結合することで解く強化学習アルゴリズムDecompRLを提案。GPUコストを約50倍削減し、標準的な生成では解けない問題を解決する。
原題: DecompRL: Solving Harder Problems by Learning Modular Code Generation / Juliette Decugis, Fabian Gloeckle, Francis Bach 他
日本語で読む → - 論文水中ロボット/強化学習/sim2realロボティクス
CORAL-AUV: CFD指向の強化学習による自律型水中ビークル制御
CFDデータから学習したサロゲート抗力モデルを強化学習に組み込み、実機の6自由度AUVにゼロショットで適用可能な制御ポリシーを初めて実証した。従来の簡易物理モデルと比較して、エネルギー消費31%削減、移動時間11%短縮、誤差19%低減を達成した。
原題: CORAL-AUV: CFD Oriented Reinforcement Learning for Autonomous Underwater Vehicles / Steven Roche, Milo Van Mooy, Nathan McGuire 他
日本語で読む → - 論文強化学習ロボティクス
VINE: 強化学習のための生成制御ポリシーの調整
フローマッチングポリシーを強化学習で安定して学習するための新しいサンプリング手法VINEを提案。各デノイズステップで補間状態を再構築し、価値勾配の伝播を安定化させる。
原題: VINE: Taming Generative Control Policies for Reinforcement Learning / Rushuai Yang, Zhuo Han, Houlin Li 他
日本語で読む → - 論文投擲/強化学習ロボティクス
多障害物環境での安全な物体投擲の学習
ロボットが障害物を避けながら目標のかごに物体を投げ入れる問題を扱い、ポテンシャル場表現を用いた強化学習で成功率90%を達成した。
原題: Learning to Throw Objects Safely in Multi-Obstacle Environments / Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei
日本語で読む → - 論文逆強化学習機械学習
一般化と誘導:少数ショット逆強化学習のための報酬分解
少数の目標タスクデモと関連タスクのデモを用いて、新しいタスクの報酬を学習する逆強化学習手法を提案。報酬を一般化可能な判別器と近接関数に分解し、探索時の誘導を実現する。
原題: Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning / Ziyi Liu, Grace Zhang
日本語で読む → - 論文強化学習ロボティクス
fNIRS誘導強化学習によるロボット行動のオフライン学習手法
脳血流信号(fNIRS)を用いてロボットの強化学習を調整する手法を提案し、オフラインデータでも学習が可能であることを示した。
原題: An offline approach to fNIRS-guided reinforcement learning for robot behavior / Julia Santaniello, Madelaine Brower, Benson Jiang 他
日本語で読む → - 論文強化学習ロボティクス
WorldSample: ワールドモデリングを用いた実機ロボットの閉ループ強化学習
実機ロボットの強化学習において、実ロールアウトとワールドモデル生成を閉ループで結び、高品質な合成遷移を生成して学習を効率化する手法を提案。ポリシー成功率を28%向上させ、訓練ステップを59%削減した。
原題: WorldSample: Closed-loop Real-robot RL with World Modelling / Yuquan Xue, Le Xu, Zeyi Liu 他
日本語で読む → - 論文強化学習機械学習
視覚強化学習の汎化のためのタスク関連表現の分離
視覚強化学習の汎化性能向上のため、観測をタスク関連・非関連表現に分離する自己教師ありアルゴリズムT2RDを提案した。
原題: Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization / Jinwen Wang, Youfang Lin, Xiaobo Hu 他
日本語で読む → - 論文オフライン強化学習機械学習
効率的なオフライン強化学習のためのショートカット軌道計画
拡散モデルによる軌道計画の推論コストを削減するため、単一ステージで学習可能なショートカット軌道モデルを提案し、ステップサイズ調整による1ステップ・数ステップ推論と、実現可能性補正付き批評家による計画選択を実現した。
原題: Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning / Guanquan Wang, Yoshimasa Tsuruoka
日本語で読む → - 論文VLA/強化学習ロボティクス
WCM: 視覚・言語・行動強化学習のためのワールドクリティックモデル
ロボット操作のためのVLAモデルの強化学習後訓練において、観測履歴を扱うクリティックの表現が時間的ダイナミクスを捉えられない問題を解決するため、将来の潜在状態を予測しつつ価値を推定する軽量なWorld Critic Modelを提案した。
原題: WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning / Senyu Fei, Xiaopeng Yu, Siyin Wang 他
日本語で読む → - 論文ロコ操作/触覚/強化学習ロボティクス
TAC-LOCO: 触覚情報を活用した四足ロボットの全身ロコ操作の統合制御
四足ロボットの動的ロコ操作において、触覚センサからの情報を潜空間表現に圧縮し、脚・腕・グリッパの統合制御に組み込む強化学習フレームワークを提案。実機でゼロショット展開し、把持力の低減と物体落下率の抑制を実証した。
原題: TAC-LOCO: Unified Whole-Body Control for Quadrupedal TACtile-Informed LOCO-Manipulation / Muqun Hu, Yuhao Zhou, Kabir Ray Malik 他
日本語で読む → - 論文強化学習/ナビゲーションロボティクス
動的障害物環境での安全飛行のための予測リスク誘導強化学習
クアッドローターの動的環境での安全航行のため、将来の衝突リスクを予測するリスクマップを強化学習で自己予測させ、視覚ポリシーを誘導する手法を提案。シミュレーションから実機へのゼロショット転送に成功。
原題: Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter / Yuchao Mei, Guohao Zhang, Luxia Ai 他
日本語で読む → - 論文強化学習ロボティクス
実世界ロボット強化学習にはデモ1回で十分
単一のデモンストレーションを用いて、実世界のロボット強化学習における介入プロセスを自動化するフレームワークAutoSERLを提案し、複数の接触を伴う操作タスクで高い成功率と堅牢性を達成した。
原題: One Demonstration Is Enough for Real-World Robotic Reinforcement Learning / Yuwan Liu, Hongze Yu, Song Liu 他
日本語で読む → - 論文シミュレーション/縫合/強化学習ロボティクス
位置ベース動力学と物質点法を用いたロボット強化学習のための外科縫合シミュレーション
縫合糸を位置ベース動力学(PBD)、軟組織を物質点法(MPM)でモデル化し、双方向接触を考慮した縫合シミュレーション環境を構築し、強化学習エージェントによる針挿入・抜去タスクの学習を実現した。
原題: Simulation of Surgical Suturing Using Position-Based Dynamics and the Material Point Method for Robot Reinforcement Learning / Tleukhan Mussin, Yafei Ou, Mahdi Tavakoli
日本語で読む → - 論文強化学習ロボティクス
PAC-ACT: アクション・チャンキング・トランスフォーマー向けのポストトレーニング型アクター・クリティック
事前学習済みのアクション・チャンキング・ポリシーに強化学習によるポストトレーニングを施し、精密な接触作業での分布シフトを改善するフレームワークを提案した。
原題: PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers / Yujie Pang, Zudong Li
日本語で読む → - 論文強化学習/多目的最適化機械学習
ベイズ最適化を用いた省エネルギー強化学習のための高効率パレートフロントモデリング
強化学習の多目的最適化において、報酬関数の重み選択を多目的ベイズ最適化で自動化し、少ない評価回数で多様なトレードオフ解を発見する手法を提案・実証した。
原題: Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization / Georg Schäfer, Jakob Rehrl, Stefan Huber 他
日本語で読む → - 論文強化学習/制御機械学習
軌道追従のための予測的強化学習
強化学習による軌道追従制御に予測情報を組み込み、シミュレーションで誤差を大幅削減。実機転送では単純な構成が最適であることを示した。
原題: Anticipatory Reinforcement Learning for Trajectory Tracking / Georg Schäfer, Jakob Rehrl, Stefan Huber 他
日本語で読む → - 論文手術ロボット/強化学習ロボティクス
RL-MACRO: マルチモーダル適応型ロボット開頭術のためのサイバネティック閉ループ知能フレームワーク
ロボット開頭術において、力覚・音響センサから隠れた温度状態を推定し、強化学習で切削パラメータを適応制御する閉ループ知能フレームワークを提案した。
原題: RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy / Xiao Zhang, Jiaxuan Li, Renzhen Le 他
日本語で読む → - 論文強化学習/カリキュラム学習/LLMロボティクス
LEACL: LLM強化による長期的操作タスクの強化学習のための自動カリキュラム学習
大規模言語モデル(LLM)を用いて複雑なタスクをサブタスクに分解し、各サブタスクの仕様を自動生成することで、スパース報酬のみで強化学習を効率的に行う自動カリキュラム学習フレームワークを提案した。
原題: LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks / Faraz Heravi, James Ouyang, Zifan Xu 他
日本語で読む → - 論文強化学習/制御ロボティクス
適応的強化学習による自律水上艇のクロスプラットフォーム制御
単一のポリシーで異なる水上艇にゼロショット適用可能な適応的強化学習手法を提案し、実機2機種で非適応ベースラインを最大58%上回る追従精度を達成した。
原題: Cross-Platform Control for Autonomous Surface Vehicles via Adaptive Reinforcement Learning / Ruiheng Jiang, Thomas Bi, Raffaello D'Andrea 他
日本語で読む → - 論文強化学習/UAV着陸ロボティクス
WaveLander: 波浪擾乱プラットフォームへのUAV着陸のための強化学習による汎用階層制御フレームワーク
波浪で動く船舶プラットフォームへのUAV自律着陸を、強化学習で垂直着陸判断と低レベル飛行安定化を分離した階層制御で実現し、未見の擾乱条件にも汎化することを示した論文。
原題: WaveLander: A Generalizable Hierarchical Control Framework for UAV Landing on Wave-Disturbed Platforms via Reinforcement Learning / Chun-Kit Li, Iok Long Sit, Ming Fung Siu 他
日本語で読む → - 論文制御/強化学習機械学習
潜在記憶宮殿:制御のための推論を自己回帰変分推論として捉える
連続制御ポリシーに適応的な推論能力を持たせるため、自己回帰潜在空間での変分推論として推論を定式化し、潜在空間強化学習で変分下界を最適化する手法を提案した。
原題: Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference / Chuning Zhu, Eva Xu, Jose Barreiros 他
日本語で読む → - 論文強化学習/制御ロボティクス
アクチュエータ動力学を考慮した物理認識型エンドツーエンド深層強化学習によるクアッドコプター制御
クアッドコプターの低レベル制御に、アクチュエータの遅れや空力モーメントを考慮した高忠実度シミュレータを用いたエンドツーエンド深層強化学習を適用し、DDPG、TD3、PPO、SACの性能を比較した。
原題: Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics / Ya-Chia Shen, Woei-Leong Chan
日本語で読む → - 論文強化学習/操作ロボティクス
HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
原題: HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models / Angen Ye, Weijie Ke, Xiaofeng Wang 他
日本語で読む → - 論文強化学習ロボティクス
Robo-ValueRL: オフラインからオンラインへの強化学習における信頼性の高い価値推定
オフラインからオンラインへの強化学習において、価値関数の信頼性がポリシー最適化に与える影響を分析する統一フレームワークを提案し、信頼性の高い価値推定が下流の性能向上に寄与することを実験で示した。
原題: Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning / Wenke Xia, Pei Ren, Wenbo Yu 他
日本語で読む →