論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転ロボティクス
D^3-MoE:スタイル制御可能なエンドツーエンド自動運転のための二重分離拡散Mixture-of-Experts
高分散な人間のデモデータで訓練されたエンドツーエンド自動運転モデルが陥る「スタイル平均化」問題を解決するため、行動軸と物理軸の二方向で軌道生成を分離する拡散MoEモデルを提案した。
原題: D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving / Renju Feng, Rukang Wang, Ning Xi 他
日本語で読む → - 論文ナビゲーションロボティクス
未マップ環境におけるアッカーマン操舵ロボットの安全な局所ナビゲーション
グローバルな目標がない未マップ環境で、障害物検出に基づき最も安全な進行方向を決定し、凸二次最適化で左右の境界線を構築して障害物を回避する局所ナビゲーション制御フレームワークを提案した。
原題: Safe Local Navigation for Ackermann-Steered Robots in Unmapped Environments / Christian Schaible, Shahin Sirouspour
日本語で読む → - 論文群制御ロボティクス
Commerge: 資源制約シナリオにおけるマルチロボット協調のための通信効率的で堅牢かつ高速なLiDAR地図マージフレームワーク
マルチロボットのLiDAR地図マージにおいて、通信量を最大5000倍削減しつつ位置合わせ精度を維持するフレームワークを提案。グラフ理論に基づく選択的データ交換により、必要なスキャンのみを送信する。
原題: Commerge: Communication-Efficient, Robust, and Fast LiDAR Map Merging Framework for Multi-Robot Coordination in Resource-Constrained Scenarios / Hogyun Kim, Jiwon Choi, Juwon Kim 他
日本語で読む → - 論文ナビゲーション画像認識
2D-3Dギャップを埋める:視覚言語ナビゲーションのための階層的意味幾何マップ
視覚言語ナビゲーションの性能を向上させるため、3D空間情報をVLMが扱える階層的マップに変換し、意味推論と経路計画を分離する手法を提案した。
原題: Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation / Kailing Li, Tianwen Qian, Lijin Yang 他
日本語で読む → - 論文4D合成ロボティクス
PhysAgent: 軌跡に基づくマルチエージェントフィードバックによる物理ベース4D合成の自動化
物理シミュレーションをループに組み込んだマルチエージェントフレームワークを提案し、力場の自動設定と物理的に妥当な4Dモーション合成を実現する。
原題: PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback / Chunji Lv, Jiaxi Ye, Yuchen Jiang 他
日本語で読む → - 論文マニピュレーションロボティクス
ForceBand: sEMGを用いた力強い操作の学習
筋電位センサを搭載したリストバンドで人間の指先の力を推定し、力情報を含むデモンストレーションを生成してロボットの力制御を学習する手法を提案した。
原題: ForceBand: Learning Forceful Manipulation with sEMG / Botao He, Zhi Wang, Linna Kuang 他
日本語で読む → - 論文UAV探査ロボティクス
スケッチからの探索:事前地図を用いた大規模環境でのUAV探査の高速化
大規模で複雑な環境でのUAV自律探査の効率を向上させるため、不正確で不完全な2D事前地図を活用する新しい探査フレームワークを提案。LiDAR観測と事前地図の頑健な位置合わせと、階層的な視点計画戦略により、探索経路を最適化する。
原題: Explore From Sketch: Accelerating UAV Exploration in Large-scale Environments with Prior Maps / Tiancheng Lai, Yuman Gao, Xiangyu Li 他
日本語で読む → - 論文シミュレーションロボティクス
NVIDIA Isaac Sim:ロボティクスのためのスケーラブルでGPU高速化されたシミュレーションを実現
本論文は、GPU高速化による大規模並列トレーニングと高精度物理シミュレーションを特徴とするNVIDIA Isaac Simのアーキテクチャと応用を体系的にレビューし、他のシミュレータとの比較や主要5分野での利用パターン、将来の課題をまとめたサーベイである。
原題: NVIDIA Isaac Sim: Enabling Scalable, GPU-Accelerated Simulation for Robotics / Sicong Gao, Maurice Pagnucco, Tomasz Bednarz 他
日本語で読む → - 論文歩行者自律航法ロボティクス
ForestBack: パンくず方式の歩行者自律航法によるインフラ不要の帰還ナビゲーション
GPSやWi-Fiなどの外部インフラに依存せず、歩行経路をパンくずノードとして記録し、逆方向の経路案内を行う帰還ナビゲーションシステムを提案した。
原題: ForestBack: Breadcrumb-Based Pedestrian Dead Reckoning for Infrastructure-Free Return Navigation / Aueaphum Aueawatthanaphisut, Chanakan Chaipan
日本語で読む → - 論文器用操作ロボティクス
EaDex: 低コストデモからのクロスエンボディ器用操作フレームワーク
単一RGB-Dカメラで人間の手の動きを捉え、MANOモデルとモーションリターゲティングで構造化デモデータを生成し、接触報酬に基づく動的デモアニーリングで学習を効率化する、低コストな多エンボディ器用操作学習フレームワークを提案した。
原題: EaDex: A Cross-Embodiment Dexterous Manipulation Framework from Low-Cost Demonstrations / Qian Zhao, Xin Tong, Chengdong Wu 他
日本語で読む → - 論文ビジュアルサーボロボティクス
ART-VS: 視覚変換器ビジュアルサーボのための適応解像度タイリング
視覚サーボの精度と頑健性のトレードオフを解決するため、粗い段階と高解像度タイリング段階を組み合わせた2段階手法を提案。追加学習なしで位置決め精度と成功率を大幅に向上させた。
原題: ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing / Alessandro Scherl, Bernhard Neuberger, Simon Schwaiger 他
日本語で読む → - 論文SLAM/世界モデルロボティクス
J-LAW: 結合潜在因子グラフによる同時位置推定と行動可能な世界モデリング
SLAMと行動条件付き世界モデルを統合し、計量ポーズと潜在状態を結合因子グラフで同時最適化する手法を提案。実データで予測精度とドリフト低減を実証。
原題: J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs / Guanqun Cao, Liang Chen
日本語で読む → - 論文ヒューマノイド/移動操作/sim2realロボティクス
VLK: 再構築シーンでの合成インタラクションによるヒューマノイドの移動操作学習
3Dガウススプラッティングで再構築した屋内シーンで、視覚・言語・運動のペアデータを合成生成し、ヒューマノイドの移動操作ポリシーを学習する手法を提案。実機Unitree G1でナビゲーションと物体運搬を実証した。
原題: VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes / Yen-Jen Wang, Jiaman Li, Sirui Chen 他
日本語で読む → - 論文VLA画像認識
LARA: 視覚言語行動モデルのための潜在行動表現の整合
本論文は、視覚言語行動モデルと潜在行動モデルを同時に最適化するプラグアンドプレイフレームワークを提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
原題: LARA: Latent Action Representation Alignment for Vision-Language-Action Models / Mengya Liu, Baoxiong Jia, Jiangyong Huang 他
日本語で読む → - 論文ナビゲーションロボティクス
WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーション
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
原題: WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation / Ning Yang, Yan Huang, Kaiwen Peng 他
日本語で読む → - 論文把握動作生成ロボティクス
人間の普遍的な把握動作の生成
スマートグラスで収集した大規模な人間の把握動作データを用いて、任意の物体に対する多様な人間の把握姿勢を生成するフローマッチングモデルを提案し、ロボットハンドへの転用でゼロショット把握を実現した。
原題: Human Universal Grasping / Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu 他
日本語で読む → - 論文キャリブレーションロボティクス
カルーセル:純回転運動を用いた非重複視野マルチカメラシステムの外部キャリブレーション
非重複視野を持つ複数カメラの外部パラメータを、単一の静的キャリブレーションボードと純回転運動のみで高精度に推定する手法を提案した。
原題: Calousel: Extrinsic Calibration of Non-overlapping Multi-camera Systems from Pure Rotation / Gwanhyeong Song, Chaehyeon Song, Ayoung Kim
日本語で読む → - 論文操作学習/転移学習ロボティクス
Human2Any: 制約を考慮した構成的プランニングによる人間からロボットへの転移
人間の動画から物体間の相互作用の事前知識を学習し、ロボットの制約を考慮したプランニングと組み合わせることで、実ロボットのデモデータなしに多様なロボットへ操作スキルを転移するフレームワークを提案。
原題: Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning / Shuo Cheng, Chuye Zhang, Alfred Cueva 他
日本語で読む → - 論文マニピュレーションロボティクス
KEMO: 長期的ロボット操作のためのイベント駆動キーフレームメモリとVLAポリシー
長期的なロボット操作において、過去の重要な状態変化をキーフレームとして自動選択・記憶し、VLAポリシーに統合する軽量なプラグインメモリフレームワークKEMOを提案。実機の双腕操作タスクで成功率を大幅に向上させた。
原題: KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies / Yihan Zeng, Minghao Ye, Yiyuan Chen 他
日本語で読む → - 論文軌道生成/拡散モデル/フローマッチングロボティクス
BayesFP: フローベース方策のためのFeynman-Kacサンプリングによる事後推定
事前学習済みの拡散・フローマッチング方策を事前分布とし、推論時に与えられるコストを尤度として事後サンプリングすることで、安全制約やタスク目的を満たす軌道生成を行う再学習不要の推論時サンプラーを提案した。
原題: BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling / Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos
日本語で読む → - 論文航法/MPC/ベイズ最適化ロボティクス
自律エージェント航法における非線形MPC学習のためのベイズ最適化
LiDARベースの占有グリッドとA*探索、非線形MPCを統合した地図不要の航法フレームワークを提案し、TPEベイズ最適化で制御パラメータを自動調整。シミュレーションで調整したパラメータが実機Unitree Go2に転移可能であることを示した。
原題: Bayesian Optimization for Learning Nonlinear MPC in Autonomous Agent Navigation / Lorenzo Ortolani, Gabriel Voss, Gabriele Beltrami 他
日本語で読む → - 論文オフライン強化学習機械学習
価値スティッチングによる地平線適応型オフライン方策学習
固定長の価値バックアップを再帰的で地平線適応的な価値合成に置き換え、将来の状態と地平線長に条件付けられた補助価値関数とスティッチング方策を用いて、オフライン強化学習の性能を向上させる手法VASTを提案した。
原題: Horizon Adaptive Offline Policy Learning via Value Stitching / Kexin Zheng, Xianyuan Zhan, Xintao Yan
日本語で読む → - 論文経路計画ロボティクス
両側曲率制約下での滑らかな測地線計算とロボティクス・画像解析への応用
曲率の上下限制約を課した測地線モデルを提案し、Hamilton-Jacobi-Bellman方程式に基づく数値解法を開発。ロボット経路計画や画像内の曲線構造追跡に応用した。
原題: Computing Smooth Geodesics under Two-Sided Curvature Bounds with Applications to Robotics and Image Analysis / Da Chen, Zhenjiang Li, Jean-Marie Mirebeau 他
日本語で読む → - 論文模倣学習ロボティクス
異種デモンストレーションからの模倣学習:接地された潜在アクション世界モデルを用いて
異なるアクション空間やラベル欠如を含む異種データソースから、予測に基づく共通の潜在アクション表現を学習し、行動クローニングポリシーを訓練する手法を提案。シミュレーションと実世界の操作タスクで有効性を実証。
原題: Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models / Tianyou Wang, Anson Lei, Joe Watson 他
日本語で読む → - 論文VLAロボティクス
CT-VAM: 小脳-視床に着想を得た効率的な視覚運動制御のための視覚行動モデル
大規模言語モデルによる高次推論とローカルでの高速制御を分離するため、小脳-視床経路に着想を得た軽量な視覚行動モデルCT-VAMを提案。68Mパラメータで大規模VLAに匹敵する性能を達成し、実機でも高速制御を実現した。
原題: CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control / Jiacheng Li, Yize Guo, Jiabin Guo 他
日本語で読む → - 論文自動運転/強化学習AI
ROSA-RL: 不確実性を考慮した強化学習によるラウンドアバウト最適速度アドバイス
ラウンドアバウト進入時の不確実性を扱うため、トランスフォーマーで将来の占有を予測し、強化学習の状態に組み込んで安全かつ効率的な速度調整を行う手法を提案した。
原題: ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning / Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger 他
日本語で読む → - 論文マニピュレーションロボティクス
把持→計画と失敗帰属:正確で汎用的なロボット操作のための閉ループ二段階フレームワーク
把持と動作計画の連携における失敗原因の曖昧さを解消するため、失敗帰属モデルを導入し、診断結果に基づいて把持候補生成と計画の両方を最適化する二段階フレームワークGTP-FAを提案した。シミュレーションと実機実験で、RL、IL、拡散ポリシー、VLAなど様々なベース学習器の成功率を向上させた。
原題: Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation / Jiahao Xu, Peiyuan Wang, Hanzhuo Zhang 他
日本語で読む → - 論文マルチエージェント協調機械学習
LLawCo: 協調の法則を学習して具現化マルチエージェント行動をモデル化する
LLMベースの具現化エージェントがパートナーや環境とずれた行動を取る問題に対し、過去の失敗から行動法則を抽出し、それを思考連鎖に組み込むフレームワークLLawCoを提案。新ベンチマークPARTNR-Dialogで成功率を向上させた。
原題: LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior / Qinhong Zhou, Chuang Gan, Anoop Cherian
日本語で読む → - 論文自動運転シミュレーション画像認識
Dash2Sim: 実走行ダッシュカム映像からのクローズドループ運転シミュレーション
単眼ダッシュカム映像から正確な4D運転ログを復元し、既存シミュレータで利用可能にするフレームワークを提案。大規模データセットROADWork4Dを構築し、工事現場シナリオでのプランナー性能を評価した。
原題: Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos / Anurag Ghosh, Francesco Pittaluga, Khiem Vuong 他
日本語で読む → - 論文セキュリティ/ワールドモデルロボティクス
ロボット学習パイプラインを侵害するためのワールドモデル攻撃
ワールドモデルを介して、一見安全な遠隔操作データに悪意のあるプロンプトや遷移ダイナミクスを埋め込み、危険な合成訓練データを生成してロボットポリシーを侵害する新たなデータポイズニング攻撃手法を提案した。
原題: Targeting World Models to Compromise Robot Learning Pipelines / Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud 他
日本語で読む →