論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/8 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習機械学習
SACにおけるtanhヤコビアンの解放:バンバン制御とMetaDriveに関する負の結果
SACのtanh圧縮による勾配消失を補正するバイパスを試したが、極端な行動が最適なタスクでも性能改善は見られず、むしろ悪化することを示した負の結果。
原題: Unthrottling the Tanh Jacobian in SAC: A Negative Result on Bang-Bang Control and MetaDrive / Faiq Shamass
日本語で読む → - 論文モデルベース強化学習ロボティクス
CAST: 交互状態価値目標と拡張方策勾配によるモデルベース強化学習
モデルベース強化学習において、プランナー誘導行動と現在の方策を交互に用いた状態価値目標を導入し、価値学習を改善する手法CASTを提案。シミュレーションと実機の四足ロボットで有効性を実証。
原題: CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning / Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard 他
日本語で読む → - 論文強化学習機械学習
SUN: 強化学習における新規性への到達
強化学習の探索において、新規性と到達可能性を同時に考慮した目標選択フレームワークSUNを提案し、到達不能な状態を含む環境で既存手法を上回る性能を示した。
原題: SUN: Reaching for Novelty in Reinforcement Learning / Wenyan Yang, Arsenii Mustafin, Dominik Baumann 他
日本語で読む → - 論文強化学習/建設ロボティクスロボティクス
連続調整による被覆構造の構築学習
事前計画なしに強化学習で構造物を適応的に組み上げる手法を提案し、シミュレーションと実機2台のロボットでアーチ構造の構築に成功した。
原題: Learning to build covering structures with continuous adjustments / Gabriel Vallat, Maryam Kamgarpour, Stefana Parascho
日本語で読む → - 論文セキュリティ/強化学習機械学習
TrojanWorld: 想像力の誘導によるワールドモデルエージェントへのバックドア攻撃
物理的な物体をトリガーとして、ワールドモデルエージェントの内部想像を操作し、攻撃者が指定した行動を誘発するバックドア攻撃フレームワークを提案した。
原題: TrojanWorld: Backdooring World-Model Agents via Imagination Steering / Wenkai Huang, Siyuan Liang, Gaolei Li 他
日本語で読む → - 論文マルチエージェント強化学習制御
予測シールディングによる分散型安全マルチエージェント強化学習
複数ロボットが独立にタスクを実行する環境で、訓練時と異なる状態に直面しても安全に適応できるよう、予測シールディングとモデルベースの有限地平Q学習を組み合わせた分散型フレームワークを提案した。対称シナリオでのライブロックを緩和する通信不要のプロトコルも導入している。
原題: Decentralized Safe Multi-Agent Reinforcement Learning via Predictive Shielding / Yacine El Yamani, Hanna Krasowski, Elena Vanneaux
日本語で読む → - 論文強化学習/手術操作ロボティクス
疎な報酬強化学習のための位相・初到達VLMフィードバック:手術操作への応用
手術操作の疎な報酬強化学習において、失敗した試行から部分的な成功段階を再利用できるよう、VLMを用いて各エピソードの到達段階とその初到達時刻を特定するフィードバック手法を提案し、シミュレーションと実機で有効性を示した。
原題: Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation / Wanli Liuchen, Fangyuan Wang, Bin Li 他
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習における拡散ポリシーのためのノイズ空間ポリシー勾配
拡散ポリシーを強化学習に統合するため、ノイズ空間で価値関数を定義し、クリーンな行動空間の価値推定のみを用いてノイズ潜在変数を最適化するポリシー勾配法を提案した。
原題: Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning / Mahmoud Selim, Cristina Cipriani, Karl H. Johansson
日本語で読む → - 論文組立/強化学習ロボティクス
知識誘導型階層ポリシー学習による高精度円筒組立
0.1mmの厳しい公差を持つ円筒部品の高精度組立を実現するため、階層型強化学習フレームワークを提案。下層は行動クローニングとTD3を統合し、上層はヒューリスティックルールで調整する。シミュレーションで学習後、実世界に転移し、高い成功率と安定性を示した。
原題: Knowledge-Guided Hierarchical Policy Learning for High-Precision Cylindrical Assembly under Tight Tolerances / Binbin Lian, Xinyu Liu, Tao Sun
日本語で読む → - 論文歩行/強化学習ロボティクス
SkillX: ヒューマノイドサッカーのための統合マルチスキルポリシー学習
ヒューマノイドサッカーにおいて、単一のコマンド条件付きポリシーでドリブル、トラップ、シュートなどの複数のスキルを学習・切り替え可能にする統一強化学習フレームワークを提案した。
原題: SkillX: Unified Multi-Skill Policy Learning for Humanoid Soccer / Zhangchen Ye, Enxuan Ruan, Yifei Bao 他
日本語で読む → - 論文強化学習ロボティクス
SCoCaT: 成功条件付き制約強化学習による宇宙機ドッキング
終端ナビゲーションタスクにおける制約付き強化学習の「実現可能性崩壊」問題を特定し、補助価値批判による成功信号の追加で解決する手法を提案・実証した。
原題: SCoCaT: Success Conditioned Constrained Reinforcement Learning for Spacecraft Docking / Aman Arora, Ricard Marsal I Castan, Matteo El-Hariry 他
日本語で読む → - 論文VLA/強化学習ロボティクス
VLA-Precision: 非対称共同ブートストラップによる視覚言語行動モデルの効率的な実世界オンライン強化学習
実世界のオンライン強化学習を用いて、精密な操作タスクにおける視覚言語行動モデルの性能を向上させるフレームワークを提案した。
原題: VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models / Chenyu Su, Zhaolong Shen, Yuan Qian 他
日本語で読む → - 論文強化学習機械学習
長期的オフライン目標条件付き強化学習のための再帰的価値学習
長期的な目標達成タスクを効率的に学習するため、軌跡を二分木に再帰的に分解し、葉から根へ価値を学習する手法DCRLを提案した。
原題: Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL / Hyeonseong Jeon, Youngwoon Lee
日本語で読む → - 論文強化学習/MPCロボティクス
MPCソルバー勾配ガイダンスによる強化学習の加速:重み可変MPC向け
モデル予測制御(MPC)のコスト重みを適応的に学習する際、強化学習のサンプル効率を向上させるため、微分可能MPCのソルバー勾配を補助ガイダンスとして利用するSG-RL手法を提案した。自動レースプラットフォームで最大70.6%のサンプル削減を実証した。
原題: Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC / Baha Zarrouki, Arslan Thobani, Jasper Hoffmann 他
日本語で読む → - 論文ソフトロボティクス/強化学習ロボティクス
ソフトロボットにおける全身インタラクションによる推論と操作の学習
ソフトロボットの腕全体を使った接触から物体情報を推論し、把持操作を行う強化学習フレームワークを提案。探索と把持を統合したリカレントポリシーとsim-to-real適応により、視覚なしでの把持を実現。
原題: Learning to infer and manipulate through distributed whole-arm interaction in a soft robot / Chuhan Zhang, Ebrahim Shahabi, Kseniia Khomenko 他
日本語で読む → - 論文マルチタスク強化学習機械学習
T3S: タスク固有特徴セレクタとスケジューラによるマルチタスク強化学習の改善
マルチタスク強化学習におけるタスク間干渉を解決するため、ハイパーネットワークでタスク固有のソフトマスクを生成する特徴セレクタと、タスクの進捗と学習速度に基づいて学習タスクを選択するスケジューラを提案した。ロボット操作タスクで既存手法より優れた性能を示した。
原題: T3S: Improving Multi-Task Reinforcement Learning with Task-Specific Feature Selector and Scheduler / Yuanqiang Yu, Tianpei Yang, Yongliang Lv 他
日本語で読む → - 論文強化学習/探索戦略ロボティクス
CIG-RL: 不確実な環境下での発生源推定のための好奇心駆動型情報誘導強化学習
ガス発生源の特性を推定する問題に対し、好奇心による探索と不確実性適応型報酬を組み合わせた強化学習手法を提案し、高ノイズ環境でのロバスト性を実証した。
原題: CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments / Junhee Lee, Seunghwan Kim, Hongro Jang 他
日本語で読む → - 論文強化学習ロボティクス
SmoothRL: 非同期実行中のオンライン強化学習
事前学習済みロボットポリシーを非同期推論ループ内でオンライン強化学習により微調整するフレームワークを提案。非同期実行を考慮した学習により、高レイテンシ環境でもスムーズな制御を実現する。
原題: SmoothRL: Online Reinforcement Learning During Asynchronous Execution / Guang Gao, Yuxuan Nong, Baifu Huang 他
日本語で読む → - 論文強化学習機械学習
PathBridger: オフライン目標条件付き強化学習のためのサブゴール橋渡し
オフライン目標条件付き強化学習において、サブゴール選択と短期実行を明示的に橋渡しする階層的手法を提案し、多物体操作タスクで大きな性能向上を達成した。
原題: PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning / Soohyun Choi, Seonvin Cho, Songnam Hong
日本語で読む → - 論文移動操作/強化学習ロボティクス
接触誘導探索による多批判的強化学習を用いた非把持移動操作
非把持操作のための接触誘導探索戦略を多批判的強化学習フレームワークに組み込み、接触を求める報酬で探索を促進し、時間とともにその影響を減衰させてタスク最適な方策を獲得する手法を提案。箱押し、椅子運搬、食洗機開閉などのタスクで評価し、実機の四足移動マニピュレータで椅子運搬を実証した。
原題: Contact-Guided Exploration for Non-Prehensile Locomanipulation with Multi-Critic RL / Simone Tolomei, Mayank Mittal, Franco Angelini 他
日本語で読む → - 論文リハビリテーションロボット/強化学習/制御ロボティクス
外乱とパラメータ不確かさ下におけるケーブル駆動下肢リハビリロボットのための残差深層強化学習に基づく計算トルク制御
ケーブル駆動下肢リハビリロボットの軌道追従精度を向上させるため、モデルベースの計算トルク制御に深層強化学習による補償トルクを追加する残差制御手法を提案し、シミュレーションで外乱や不確かさに対する頑健性を検証した。
原題: Residual Deep Reinforcement Learning-Based Computed Torque Control for a Cable-Driven Lower-Limb Rehabilitation Robot under Disturbances and Parametric Uncertainties / Mohammad-Hossein Fakouri, Ali Keymasi-Khalaji
日本語で読む → - 論文強化学習機械学習
到達して生き残る:1ビットの失敗信号からの安全な目標条件付きポリシー学習のスケーリング
失敗終了型マルコフ決定過程における対比強化学習の理論的欠陥を指摘し、質量重み付きInfoNCEと対数生存質量スコアによる修正を加えたSafe-CRLを提案。12のロボットナビゲーション・歩行タスクで生存率と目標到達性能を向上させた。
原題: Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals / Guopeng Li, Yiyang Duan, Yiru Jiao 他
日本語で読む → - 論文強化学習機械学習
WarpSAC: 探索と活用の再考によるスケーラブルなオフ方策強化学習の頂点を目指して
データ量に応じて安定化手法を適応させるオフ方策RLアルゴリズムWarpSACを提案し、CPU/GPU並列環境で既存手法を大幅に上回る性能を達成した。
原題: WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation / Zihao Wu, Hongyao Tang, Yi Ma 他
日本語で読む → - 論文駐車計画/強化学習ロボティクス
NeuralParker: 不規則な駐車環境のための強化学習プランナー
配送車両などが不規則な環境で任意の姿勢に駐車するための強化学習ベースのハイブリッドプランナーを提案。環境全体の障害物と境界を目標相対表現で符号化し、長距離の経路計画を可能にした。
原題: NeuralParker: A Reinforcement Learning Planner for Irregular Parking Environments / Zihan Wang, Bai Huang, Yang Guan 他
日本語で読む → - 論文オフライン強化学習機械学習
CoDrift: オフライン強化学習のための合成的ドリフト
オフライン強化学習の複数の目的をアクション空間の運動場として捉え、それらを合成して一つの生成ポリシーを学習するフレームワークCoDriftを提案。73タスクで最先端手法と同等以上の性能を達成。
原題: CoDrift: Compositional Drifting for Offline Reinforcement Learning / Xiewei Ni, Ruofeng Mei, Xiangyu Xu
日本語で読む → - 論文強化学習/適応ロボティクス
報酬なし連続適応による耐障害宇宙ロボット
宇宙ロボットのハードウェア劣化に対応するため、報酬信号なしで適応可能な報酬フリー連続学習フレームワークを提案。事前学習した世界モデルの遷移ダイナミクスのみを更新し、想像上の軌道でポリシーを訓練する。
原題: Reward-Free Continual Adaptation for Resilient Space Robots / Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez
日本語で読む → - 論文強化学習/故障適応ロボティクス
特権的批評家トレーニングによるセンサ不要のスラスタ故障適応:エンドツーエンド強化学習
スラスタ駆動ロボットの故障耐性ナビゲーションにおいて、訓練中にのみ真の故障状態を価値関数へ与える特権的批評家トレーニングにより、センサなしで故障適応を実現する手法RAFTを提案した。
原題: Privileged Critic Training Enables Sensor-Free Thruster Fault Adaptation in End-to-End RL / Ricard Marsal I Castan, Miguel A. Olivares-Méndez
日本語で読む → - 論文VLA/強化学習ロボティクス
CounterAlign: 視覚言語行動モデルのための反事実的監督
専門家のデモンストレーションのみから、指示を入れ替えることで反事実的なデータを合成し、オフライン強化学習の報酬モデルを学習する手法を提案。ロボット操作の堅牢性を向上させる。
原題: CounterAlign: Counterfactual Supervision for Vision-Language-Action Models / Haru Kondoh, Kei Ota, Asako Kanezaki 他
日本語で読む → - 論文強化学習自然言語
EDGE: エージェント強化学習における誘導探索のための経験蒸留
強化学習で得た経験を一時的な学習支援として使い、徐々にパラメータに内化させるフレームワークEDGEを提案。推論時の外部依存をなくし、複数タスクで性能を向上させた。
原題: EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning / Can Xie, Yuyi Zhou, Wen Yang 他
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習のためのポリシー抽出の分離
オフライン強化学習では、アクターと批評家を同時に訓練する従来の手法が、固定データによる過大評価やOOD行動の問題を引き起こす。本論文では、アクターを行動分布のモデリングに限定し、推論時に批評家が候補行動を再ランク付けする「分離ポリシー抽出」パラダイムを提案し、性能向上を実証した。
原題: Decoupling Policy Extraction for Offline Reinforcement Learning / Xuyao Lin, Yixiang Shan, Jinru Duan 他
日本語で読む →