論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文模倣学習ロボティクス
不完全なデモンストレーションからの局所性能認識型能動学習
不完全な人間のデモンストレーションからロボットが学習する際、局所的な品質情報を活用して能動的に追加データを収集し、性能を向上させる手法を提案した。
原題: LOPAL: Local Performance-Aware Active Learning from Imperfect Demonstrations / Johannes Heidersberger, Shail Jadav, Dongheui Lee
日本語で読む → - 論文拡散ポリシー/行動生成ロボティクス
拡散ポリシーを用いた新行動の誘導的発見
拡散ポリシーのサンプリングを誘導し、多様で実行可能な新しい行動を系統的に発見・学習するフレームワークを提案した。
原題: Guided Discovery of New Behaviors using Diffusion Policies / Dian Yu, Sebastian Sanokowski, Majid Khadiv
日本語で読む → - 論文ロボットハンド設計ロボティクス
人間のデモンストレーションからロボットハンドを生成する
人間の指先動作データを用いて、ロボットハンドの設計を自動生成するデータ駆動型フレームワークを提案した。
原題: Generating Robot Hands from Human Demonstrations / Sha Yi, Nicklas Hansen, Xueqian Bai 他
日本語で読む → - 論文ナビゲーション/VLA/強化学習ロボティクス
専門家ガイドGRPOによる意図に正確に沿ったVLA空中ナビゲーション
VLAモデルを用いたUAVナビゲーションにおいて、専門家データで強化した強化学習フレームワークEG-GRPOを提案し、複雑な指示への意図整合性と成功率を大幅に向上させた。
原題: Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO / Tianyang Chen, Wenjun Li, Xin zhou 他
日本語で読む → - 論文マニピュレーションロボティクス
FAWAM: 力覚を考慮した世界行動モデルによる閉ループ接触リッチ操作
接触を伴う操作タスクにおいて、力覚情報を認識・予測・実行時補正の3段階で活用するモデルを提案し、成功率を大幅に向上させた。
原題: FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation / Haotian He, Zeyu Yan, Qipeng Liu 他
日本語で読む → - 論文具現化AI/医療AI
次世代医療に向けて:知覚・意思決定・行動のための医療具現化AIのサーベイ
医療分野における具現化AI(身体を持つAI)の研究を、知覚・意思決定・行動の統合システムとして体系的に整理したサーベイ論文。応用事例やデータセット、実臨床での課題と今後の研究方向をまとめている。
原題: Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action / Cheng Zhang, Qing Cai, Xingzheng Wu 他
日本語で読む → - 論文自動運転/シミュレーションロボティクス
ReactSim-Bench: 自動運転における反応的行動ワールドモデルシミュレーションのベンチマーク
自動運転シミュレーションのための行動ワールドモデルの反応能力を評価する新しいベンチマークを提案し、エージェントと自動運転車の制御を分離して、ログと異なる自動運転車の行動に対する反応を評価する。
原題: ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving / Zhiyuan Zhang, Yanlun Peng, Jianing Zhang 他
日本語で読む → - 論文ワールドモデルロボティクス
SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイム
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
原題: SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models / Ziheng He, Yixiang Chen, Ning Yang 他
日本語で読む → - 論文社会的ナビゲーション/VLAロボティクス
見たものに基づいて行動する:視覚言語行動モデルにおける安全な社会的ナビゲーションの実現
事前学習済みの視覚言語行動(VLA)モデルが歩行者と障害物の区別や衝突予測信号を内部表現に持つことを利用し、注釈不要の2段階ポストトレーニング手法SALSAを提案。反事実的なシーンと将来リスクの教師信号で行動生成と潜在表現を整合させ、近接衝突を86.4%削減した。
原題: Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models / Qingzi Wang, Xiyang Wu, Guangyao Shi 他
日本語で読む → - 論文模倣学習ロボティクス
タスク編集による汎用3D視覚運動ポリシー学習
3D視覚運動ポリシーの学習効率を高めるため、タスクをシーン・スキル・オブジェクトに分解し再結合するデモ生成フレームワーク「Task-Edit」を提案した。実世界実験で、長期的操作タスクにおける汎化性能の向上を実証した。
原題: Task Editing for Generalizable 3D Visuomotor Policy Learning / Jian-Jian Jiang, YiHan Yang, Lan Wei 他
日本語で読む → - 論文マニピュレーションロボティクス
KPGrasp: 器用な把持生成のためのスケーラブルなキーポイントフローマッチング
接触損失やテスト時の接触ベースの改良に頼らず、大規模データから器用な把持の事前分布を学習するフローマッチングフレームワークを提案した。
原題: KPGrasp: Scalable Keypoint Flow Matching for Dexterous Grasp Generation / Yuansen Huang, Jiayi Chen, Haoran Liu 他
日本語で読む → - 論文自動運転ロボティクス
言語駆動による自動運転のコスト最適化
大規模言語モデルを用いて、ユーザーの自然言語クエリから自動運転のコスト関数パラメータを生成し、人間の確認を挟みながら車両挙動を直感的に調整するフレームワークを提案した。
原題: Language-Driven Cost Optimization for Autonomous Driving / Diego Martinez-Baselga, Khaled Mustafa, Javier Alonso-Mora
日本語で読む → - 論文ヒューマノイド/シミュレーションロボティクス
SIMPLE: ヒューマノイドの移動操作のためのシミュレーションベースのポリシー学習と評価
ヒューマノイドの全身移動操作タスクを対象とした、大規模で再現可能な統一シミュレーションテストベッドを提案し、多様なタスクとデータ生成パイプラインを統合して、シミュレーションと実世界の性能相関を示した。
原題: SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation / Songlin Wei, Zhenhao Ni, Jie Liu 他
日本語で読む → - 論文手術支援ロボティクス
EMGに基づく異方性仮想拘束の適応制御によるロボット支援手術の切除・剥離支援
手術支援ロボットにおいて、筋電位信号から術者の意図を推定し、仮想拘束の形状をリアルタイムに適応させる枠組みを提案。切除・剥離タスクで精度と動作の一貫性が向上し、認知負荷も軽減された。
原題: EMG-Based Adaptation of Anisotropic Virtual Fixtures for Robot-Assisted Surgical Resection and Dissection / Dario Onfiani, Michael Dyck, Luigi Biagiotti 他
日本語で読む → - 論文BEV物体検出画像認識
歪みを考慮したPETR:ピンホール・魚眼混在カメラによるBEV物体検出
魚眼カメラの強い放射歪みに対応するため、歪みを考慮した位置埋め込みと特徴・幾何の相互変調を導入した投影不要のBEV検出器DAPETRを提案した。
原題: Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras / Xiangzhong Liu
日本語で読む → - 論文模倣学習/軌道生成ロボティクス
リーマン多様体上のデモンストレーション学習:ニューラルODEを用いた拡張アブストラクト
ロボットの状態(特に姿勢)が曲がった空間で変化することを考慮し、リーマン多様体上でデモンストレーションから学習する手法を提案。測地線をニューラル常微分方程式で数値推定し、計算コストを削減する。
原題: Learning from Demonstrations over Riemannian Manifolds using Neural ODEs: An Extended Abstract / Diana Cuervo Espinosa, Mahathi Anand, Angela P. Schoellig
日本語で読む → - 論文自動運転計画ロボティクス
DriveAnchor: 自動運転計画のためのプログレッシブ・アンカーベースフロー学習
自動運転の計画タスクにおいて、軌道の多様性・制御可能性・安全性を備えた3段階フレームワークを提案し、衝突率を89%削減した。
原題: DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning / Limin Yan, Haoyun Tang, Yutao Qiu 他
日本語で読む → - 論文自動運転ロボティクス
CARVE: 対話型運転のための包絡線による拒否操作の認証済み低コスト修復
自動運転において、ルール違反で拒否された操作を、他エージェントの小さな協力で修復可能な場合に、その修復を認証する手法を提案した。
原題: CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving / Yifan Wang
日本語で読む → - 論文自動運転認識画像認識
バランス学習とマルチセンサ融合によるコンパクトな自動運転認識
複数の自動運転認識タスクを1回の推論で処理するコンパクトな深層マルチタスク学習モデルを提案し、不均衡学習問題への適応的損失重み付けアルゴリズムと中間センサ融合技術を導入した。
原題: Towards Compact Autonomous Driving Perception with Balanced Learning and Multi-sensor Fusion / Oskar Natan, Jun Miura
日本語で読む → - 論文マニピュレーションロボティクス
記号的プランニングと残差オペレータ学習による逆操作
ロボット操作タスクの逆操作を、デモから抽出した記号的オペレータと強化学習による残差制御を組み合わせたハイブリッドフレームワークで実現する論文。
原題: Inverse Manipulation through Symbolic Planning and Residual Operator Learning / Yigit Yildirim, Giuseppe Rauso, Riccardo Caccavale 他
日本語で読む → - 論文地図メンテナンスロボティクス
MTD-Map: 混合遷移分布による単一ステージの長期LiDAR地図メンテナンスフレームワーク
動的物体除去と変化検出を単一フレームワークで統合し、混合遷移分布モデルを用いて占有遷移の方向と持続時間を符号化することで、長期LiDAR地図を効率的にメンテナンスする手法を提案した。
原題: MTD-Map: Single-Stage Long-Term LiDAR Map Maintenance Framework via Mixture Transition Distribution / TaeYoung Kim, Gilhwan Kang, Tae Ihn Kim 他
日本語で読む → - 論文マニピュレーションロボティクス
Trans2Occ: 透明物体のボクセル占有推定と把持 - シミュレーションから実世界へ
単一RGB画像から透明物体のボクセル占有を直接予測し、シミュレーションで大規模学習したモデルを実ロボットに微調整なしで適用して把持を実現する枠組みを提案した。
原題: Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality / Yixuan Yang, Sha Zhang, Rui Li 他
日本語で読む → - 論文移動操作ロボティクス
SplitAdapter: 負荷を考慮したヒューマノイド移動操作の因子分解適応
物体の重さや持ち上げ高さの変化に頑健なヒューマノイドの移動操作を実現するため、事前学習済みポリシーを拡張し、負荷と動力学の文脈を分離して適応する手法を提案した。シミュレーションと実機で重い負荷条件下での成功率を向上させた。
原題: SplitAdapter: Load-Aware Humanoid Loco-Manipulation via Factorized Adaptation / Jeonguk Kang, Hanbyel Cho, Sanghyun Kang 他
日本語で読む → - 論文強化学習/ドローン着陸ロボティクス
PerchRL: 高速・不規則運動する傾斜プラットフォームへの視覚ベース俊敏着陸
クアッドローターが高速で不規則に動く傾斜プラットフォームへ視覚のみで着陸する強化学習フレームワークを提案。状態ベース事前学習と視覚ベース微調整の二段階学習と、視覚喪失への頑健性向上手法により、シミュレーションと実機で有効性を実証した。
原題: PerchRL: Vision-Based Agile Perching on Inclined Platforms under Rapid and Irregular Motion / Zihong Lu, Zongzhuo Liu, Huaxu Li 他
日本語で読む → - 論文計画/LLM/シミュレーションロボティクス
PerceptTwin: 反復LLM計画と検証のための意味的シーン再構築
ロボットの知覚スタックが生成する意味的シーン表現から、対話型シミュレーションを自動構築するパイプラインを提案。LLMプランナーの計画検証・改善に活用し、成功率を平均約39%向上させた。
原題: PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification / Charlie Gauthier, Sacha Morin, Liam Paull
日本語で読む → - 論文操作/VLAロボティクス
VoLo: オープン語彙の長期的操作のための物理オーケストレータ
VLMがロボットの多様な能力を中断可能なツールとして統合し、長期的な操作タスクを計画・実行・監視・回復するエージェントループを提案。高忠実度ベンチマークRoboVoLoで評価し、既存手法を上回る性能を実証。
原題: VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation / Siyi Chen, Hugo Hadfield, Alex Zook 他
日本語で読む → - 論文触覚ロボティクス
N2D触覚グローブ:接触を伴う操作のための2次元方向力フィードバック対応多指グローブ
指先に2次元の方向性力を提示できる多指触覚グローブを開発し、ロボット遠隔操作での接触力誤差低減と操作一貫性向上を実証した。
原題: The N2D Haptic Glove: A Multi-Finger Glove for 2D Directional Force Feedback for Contact Rich Manipulation / Yao-Ting Huang, Jake Honma, Omar Hernandez 他
日本語で読む → - 論文布操作ロボティクス
推論時シミュレータ・インザ・ループ精緻化による堅牢な布操作の実現
単一RGB画像からの実世界布操作を、シミュレータを推論時に用いて軌道を精緻化する手法で実現し、成功率と堅牢性を向上させた。
原題: Enabling Robust Cloth Manipulation via Inference-Time Simulator-in-the-Loop Refinement / Xin Liu, Yulin Li, Ziming Li 他
日本語で読む → - 論文群制御ロボティクス
LAEI: 堅牢なUAV群運用のための階層型自律エッジインテリジェンスフレームワーク
UAV群の協調運用において、中央集権方式の通信ボトルネックと完全分散方式のミッション整合性不足を解決するため、各UAVのオンボード学習ポリシーと軽量なミッション監視層を組み合わせた階層型フレームワークを提案した。
原題: LAEI: Layered Autonomous Edge Intelligence Framework for Robust UAV Swarm Operations / Changmin Park, Wooyong Jung, Hwangnam Kim
日本語で読む → - 論文VLAロボティクス
ACE-Ego-0: 自己中心視点の人間とロボットデータを統合したVLA事前学習
ロボットの軌跡データ収集のコストを抑えるため、大規模な自己中心視点の人間ビデオを擬似行動ラベルに変換し、ロボットデータと統合してVLAモデルを事前学習するフレームワークを提案した。
原題: ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining / Hao Li, Ganlong Zhao, Yufei Liu 他
日本語で読む →