論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習/探索ロボティクス
DF-ExpEnse: 拡散フィルタ探索によるサンプル効率的なファインチューニング
事前学習済みの生成制御ポリシーをオンライン経験でファインチューニングする際、探索の質を高めてサンプル効率を向上させる手法を提案。
原題: DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning / Calvin Luo, Chen Sun, Shuran Song
日本語で読む → - 論文強化学習/報酬設計ロボティクス
強化学習のための段階遷移型高密度報酬モデリング
専門家のデモ動画からタスクの段階構造を推論し、段階遷移と段階内進捗の2つの報酬信号を生成することで、長期的なロボット操作タスクの強化学習を効率化する手法を提案した。
原題: Stage-Transition Dense Reward Modeling for Reinforcement Learning / Yang Yang, Bingjie Chen, Zihan Wang 他
日本語で読む → - 論文強化学習/計画ロボティクス
回復・発見・計画:ロボットの失敗からスキルと概念を学習する
ロボットが失敗から回復するだけでなく、将来の失敗を避けるための抽象的な知識を獲得する手法を提案。強化学習で回復スキルを学び、その経験から関係述語を発見して抽象計画に活用する。
原題: Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures / Bowen Li, Mayank Mishra, Y. Isabel Liu 他
日本語で読む → - 論文強化学習ロボティクス
因果報酬ワールドモデル:自動スキル生成のためのゼロショット報酬設計
因果関係を明示的にモデル化した報酬ワールドモデルを提案し、LLMによる報酬生成を因果的制約で導くことで、環境フィードバックなしのゼロショット報酬設計を実現した。
原題: Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation / Yang Yang, Yuchuang Tong, Zhengtao Zhang 他
日本語で読む → - 論文自動運転/強化学習AI
ROSA-RL: 不確実性を考慮した強化学習によるラウンドアバウト最適速度アドバイス
ラウンドアバウト進入時の不確実性を扱うため、トランスフォーマーで将来の占有を予測し、強化学習の状態に組み込んで安全かつ効率的な速度調整を行う手法を提案した。
原題: ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning / Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger 他
日本語で読む → - 論文強化学習/適応ロボティクス
動力学は教えられるものではなく学習されるもの:潜在動力学幾何の半教師あり発見によるゼロショット方針適応
ロボット強化学習において、環境の動力学変化に頑健に適応するため、物理パラメータを明示せずに相互作用の結果から潜在空間の幾何構造を学習する手法を提案し、MuJoCoベンチマークで既存手法を上回る性能を示した。
原題: Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation / Zhiming Xu, Weitao Zhou, Xianghui Pan 他
日本語で読む → - 論文オフライン強化学習機械学習
RS-Diffuser: リスク感受性拡散プランニングと分布価値ガイダンス
オフライン強化学習において、リスク中立な拡散プランナーが稀な壊滅的結果を見落とす問題に対し、分布価値クリティックと尾部リスク指標を用いたリスク感受性ガイダンスを導入し、推論時のリスクパラメータ変更だけでリスク回避・中立・追求行動を柔軟に生成できるフレームワークを提案した。
原題: RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance / Shiqiang Gong
日本語で読む → - 論文VLA/強化学習ロボティクス
本能を信じよ:視覚言語行動モデルのための信頼度駆動型テスト時強化学習
視覚言語行動モデル(VLA)が内部の評価能力を持ち、高信頼度の軌道が成功しやすいことを利用し、外部報酬なしで自己改善するテスト時強化学習フレームワークT^2VLAを提案した。
原題: Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models / Siyao Chen, Jiakang Yuan, Jiaxin Wang 他
日本語で読む → - 論文安全強化学習/VLAロボティクス
SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
原題: SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model / Kai Tang, Peidong Jia, Zhong Chu 他
日本語で読む → - 論文強化学習機械学習
正則化された報酬・罰則強化学習
報酬追求と罰則回避のポリシーを相互に事前分布として連携させるフレームワークKCPRを提案し、その深層実装klDMPがグリッドワールドとロボットナビゲーションで安全性と学習安定性を向上させることを示した。
原題: Regularized Reward-Punishment Reinforcement Learning / Jiexin Wang, Eiji Uchibe
日本語で読む → - 論文強化学習機械学習
視覚言語モデルのガイダンスによるポテンシャルベース報酬整形の自動化
視覚言語モデル(VLM)のフィードバックを用いてポテンシャル関数を学習し、報酬整形を自動化するフレームワークVLM-PBRSを提案した。スパース報酬環境での学習を加速しつつ、最適方策を保持することを実証した。
原題: Automating Potential-based Reward Shaping with Vision Language Model Guidance / Henrik Müller, Daniel Kudenko
日本語で読む → - 論文強化学習/操作ロボティクス
FlowDPG: フローマッチングポリシーに対する決定論的ポリシー勾配の実世界操作への応用
フローマッチングポリシーにDDPGスタイルの強化学習を適用する際、時間方向の逆伝播(BPTT)を回避する蒸留フレームワークを提案し、実世界の長期的な両腕組み立てタスクで92%の成功率を達成した。
原題: FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation / Kexin Shi, Junyao Shi, Poorvi Hebbar 他
日本語で読む → - 論文強化学習機械学習
UBP2: 不確実性バランス型選好計画による効率的な選好ベース強化学習
報酬・ダイナミクス・価値関数の不確実性を統合したスコアで軌道を計画し、能動的探索を行うモデルベースの選好強化学習手法を提案した。
原題: UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning / Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang 他
日本語で読む → - 論文自動運転/強化学習ロボティクス
PlanRL: 強化学習ベース運転エキスパートのための軌道計画アーキテクチャ
強化学習による自動運転エージェントが直接制御コマンドを出力する問題を解決するため、ポリノミアル軌道プランナと統合した新しいアーキテクチャを提案。Frenet座標系と運動学的実現可能性チェックを導入し、CARLAベンチマークで既存手法を上回る性能を達成した。
原題: PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts / Joonhee Lim, Yongjae Lee, Jangho Shin 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
マルチエージェント強化学習による協調的な長縄跳び
複数の人型ロボットが協力して長縄跳びを行うためのマルチエージェント強化学習フレームワークを提案し、シミュレーションと実機でその有効性を実証した。
原題: Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning / Zihao Wang, Shijie Peng, Kerui Wu 他
日本語で読む → - 論文両手操作/データ生成/強化学習ロボティクス
言語条件付き両手巧緻操作のための強化学習によるスケーラブルなマルチタスクデータ生成
両手巧緻操作の汎用ポリシー学習に必要な大規模データを、強化学習と汎用報酬設計・ドメインランダム化・言語注釈を組み合わせたパイプラインでシミュレーション生成し、マルチタスク学習の汎化性能を向上させた。
原題: Scalable Multi-Task Data Generation via Reinforcement Learning for Language-Conditioned Bimanual Dexterous Manipulation / Zechu Li, Yufeng Jin, Puze Liu 他
日本語で読む → - 論文強化学習ロボティクス
意味的強化学習による汎用ロボットポリシーの適応
汎用ロボットポリシーを強化学習で適応させる際、アクション空間ではなく言語プロンプト空間を最適化する手法を提案し、複雑な長期的タスクを解決できることを示した。
原題: Adapting Generalist Robot Policies with Semantic Reinforcement Learning / Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen 他
日本語で読む → - 論文強化学習/医療ロボティクスロボティクス
RobOralScan: ロボットによる歯科再構成のための能動的口腔内スキャン学習
強化学習を用いて、ロボットが自動で口腔内をスキャンし、歯の3次元再構成を行う初のパイプラインを提案した論文。
原題: RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction / Jinhyung Lee, Haeun Yun, Siwon Kim 他
日本語で読む → - 論文強化学習ロボティクス
WAM-RL: 再構成報酬とオンラインビデオSFTを用いたワールド・アクションモデル強化学習
ワールドモデルとアクションモデルをオンライン環境相互作用で共同最適化する強化学習フレームワークを提案し、長期的タスクでの性能向上を実証した。
原題: WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT / Zezhong Qian, Xiaowei Chi, Yu Qi 他
日本語で読む → - 論文ドローン/強化学習ロボティクス
投擲を学ぶ:クアッドローターによるケーブル吊り下げペイロードの機敏かつ正確な配送
クアッドローターが吊り下げたペイロードを目標へ正確に投げる強化学習ポリシーを、高精度シミュレーションと実機で検証し、モデルベース手法より誤差と時間を大幅に削減した。
原題: Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor / Yifan Zhai, Elia Raimondi, Yunfan Ren 他
日本語で読む → - 論文VLA/強化学習ロボティクス
弾性クエリ強化学習:VLAモデルの自己認識型ポリシー実行
VLAモデルの推論・再計画スケジュールを固定せず、状態の難易度に応じてクエリの入力・ノイズ除去予算・アクション長を動的に調整する枠組みEQRLを提案。軽量な適応器と批評家の不一致による難易度信号で計算資源を効率的に配分し、シミュレーションと実機で推論コストを削減しつつ成功率を維持・向上させた。
原題: Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models / Ge Wang, Xinyu Tan, Xiang Li 他
日本語で読む → - 論文オフライン強化学習機械学習
価値スティッチングによる地平線適応型オフライン方策学習
固定長の価値バックアップを再帰的で地平線適応的な価値合成に置き換え、将来の状態と地平線長に条件付けられた補助価値関数とスティッチング方策を用いて、オフライン強化学習の性能を向上させる手法VASTを提案した。
原題: Horizon Adaptive Offline Policy Learning via Value Stitching / Kexin Zheng, Xianyuan Zhan, Xintao Yan
日本語で読む → - 論文強化学習/四足ロボット/操作ロボティクス
アフォーダンスに基づく階層型強化学習による四足ロボットの脚操作
四足ロボットの物体操作において、専門家による高レベル軌道設計を不要にするため、ポーズと接触点のアフォーダンスを利用した3層の階層型強化学習フレームワークを提案し、シミュレーションと実世界で検証した。
原題: Affordance-Based Hierarchical Reinforcement Learning for Quadruped Pedipulation / Tuba Girgin, Jose Castelblanco, Gabriel Rodriguez 他
日本語で読む → - 論文強化学習ロボティクス
時間的自己模倣学習
ロボット操作の強化学習において、学習中に発見された時間的に効率的な成功軌道を自己模倣学習で再利用し、長期的なタスクの学習効率と成功率を向上させるフレームワークを提案した。
原題: Temporal Self-Imitation Learning / Yinsen Jia, Boyuan Chen
日本語で読む → - 論文制御/強化学習ロボティクス
車輪付き四足ロボットのレース: モデル予測制御による能動的荷重移動の緩和
四足ロボットのレース中に発生する横方向の荷重移動を、MPCと強化学習を組み合わせた階層制御で能動的に抑制し、旋回性能と安定性を向上させた。
原題: Racing a Wheeled Quadruped: Active Load Transfer Mitigation via Model Predictive Control / Marla Eisman, Brian Lam, Samuel Sonnino 他
日本語で読む → - 論文VLA/強化学習ロボティクス
FlowPRO: フローマッチングVLAの報酬なし強化学習による微調整 - 近接化選好最適化を用いて
フローマッチング型VLAモデルを実ロボットに展開可能なポリシーへと微調整する、報酬なしのオフライン強化学習フレームワークFlowPROを提案。選好最適化に近接正則化を導入し、介入・ロールバックデータから高品質なポリシーを学習する。
原題: FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization / Yihao Wu, He Zhang, Junbo Tan 他
日本語で読む → - 論文VLA/強化学習機械学習
ROAD-VLA: 自己蒸留による視覚言語行動モデルのロバストなオンライン適応
ロボット操作のための視覚言語行動モデル(VLA)のオンライン適応を強化するため、行動空間で近位教師を構築する自己蒸留フレームワークを提案。スパースな報酬を密なトークンレベルの信号に変換し、PPOを上回る性能を示した。
原題: ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models / Kejing Wang, Toan Nguyen, Minh Hoang Nguyen 他
日本語で読む → - 論文強化学習/ドローンレース/ゼロショット汎化ロボティクス
強化学習による敏捷な飛行における性能と汎化の橋渡し
ドローンレースの強化学習において、タスク認識型スイッチングと物理情報に基づく手続き型トラック生成器を組み合わせ、テスト時適応なしでゼロショット汎化を実現するフレームワークを提案した。
原題: Bridging Performance and Generalization in Reinforcement Learning for Agile Flight / Jonathan Green, Jiaxu Xing, Nico Messikommer 他
日本語で読む → - 論文制御/強化学習ロボティクス
平均電力予算制約下での水中ビークル制御:制約付き強化学習によるアプローチ
水中ビークルのスラスタ消費電力を明示的な予算制約として扱う制約付き強化学習(PPO-Lagrangian)を提案し、タスク精度を保ちつつ消費電力を削減する制御器を学習する。
原題: Average-Power-Budgeted Underwater Vehicle Control via Constrained Reinforcement Learning / Yinuo Wang, Gavin Tao, Yuze Liu 他
日本語で読む → - 論文強化学習/報酬設計機械学習
報酬設計エージェント:強化学習のための報酬設計
視覚言語モデルを用いて報酬関数を自動設計・改善するエージェントフレームワークを提案し、指示に沿ったロボット操作ポリシーを実現した。
原題: RDA: Reward Design Agent for Reinforcement Learning / Hojoon Lee, Ajay Subramanian, Ben Abbatematteo 他
日本語で読む →