論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文SLAM/水中マッピングロボティクス
パミールのマッピング:水中難破船のマルチセッションビジュアル慣性SLAMと3次元再構成
手頃なアクションカメラとダイブコンピュータの深度データを用いて、水中環境のマルチセッションマッピングを行うフレームワークを提案し、バルバドス沖の難破船の外部と内部を複数セッションで3次元再構成した。
原題: Mapping Pamir: Multi-Session Visual-Inertial SLAM and 3D Reconstruction of an Underwater Shipwreck / Michalis Chatzispyrou, Luke Horgan, Hyunkil Hwang 他
日本語で読む → - 論文マニピュレーションロボティクス
HCPG-Flow:フローポリシーによるロボット操作のための階層的接触進行ガイダンス
フローポリシーによるロボット操作において、接触前後で階層的な物体中心の進行指標を用いて候補動作を選択する手法を提案し、シミュレーションと実機で成功率を向上させた。
原題: HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation / Guanghu Xie, Mingxu Li, Shuo Zhang 他
日本語で読む → - 論文歩行機械学習
模倣学習に基づく再利用可能なハイブリッド動作プリミティブによる人型ロボット歩行
人型ロボットの歩行制御を、モーションキャプチャの模倣学習で得たスキルを再利用可能な動作プリミティブに変換し、様々なタスクに適用する手法を提案した。
原題: Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation / Valerio Belli, Valerio Modugno, Enrico Mingo Hoffman 他
日本語で読む → - 論文VLA/長期メモリ/操作ロボティクス
NativeMEM: 長期ホライズンのロボット操作のためのネイティブメモリ圧縮
事前学習済みVLAモデルが高頻度更新で長い視覚履歴を保持できるように、VLA自身の視覚エンコーダを再利用して各フレームを単一トークンに圧縮するメモリ圧縮方式を提案。外部メモリや新規モジュール不要で、シミュレーション成功率を32.4%から84.0%に向上させた。
原題: NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation / Ziye Wang, Modi Shi, Chaojun Ni 他
日本語で読む → - 論文自動運転/意思決定ロボティクス
自動運転における相互作用を考慮した注意機構ベースの高レベル意思決定学習
自動運転の車線変更や速度制御の高レベル意思決定を、動的な交通状況に応じて可変長の入力に対応しつつ、相互作用を明示的にモデル化する注意機構ベースのアーキテクチャDecisionPerceiverを提案した。固定サイズの潜在空間への投影と細かい行動離散化により、性能とスケーラビリティを向上させた。
原題: Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving / Marcelo Contreras, Willi Poh, Christoph Stiller 他
日本語で読む → - 論文ナビゲーションロボティクス
差分に基づく関係学習によるゼロショット物体目標視覚ナビゲーションと直接的なシミュレーションから実機への転移
物体の見た目やカメラ視野角の違いによるシミュレーションと実環境のギャップを克服するため、差分特徴抽出と時間的バッファを組み合わせたT-DRNを提案し、AI2-THORと実機ロボットでゼロショット転移の性能を検証した。
原題: Difference-Based Relational Learning for Zero-Shot Object-Goal Visual Navigation With Direct Sim-to-Real Transfer / Guolei Qi, Feitian Zhang
日本語で読む → - 論文セキュリティcs.CR
LVLM搭載ロボットシステムに対する過剰思考誘発型スローダウン攻撃
ロボットに搭載された大規模視覚言語モデル(LVLM)の過剰思考(長い推論)を悪意あるシーンテキストで誘発し、意思決定を遅延させる攻撃手法を提案・検証した論文。
原題: Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems / Qiang Han, Jie Wu, Bo Chen
日本語で読む → - 論文カメラキャリブレーションロボティクス
観測品質が重要: 失敗指向解析による頑健なマルチ魚眼カメラキャリブレーション
マルチ魚眼カメラのキャリブレーション失敗の主因が内部パラメータ初期化にあることを解析し、それを踏まえたデータ構築フレームワークCO-Calibを提案。成功率を68.1%から99.3%に向上させた。
原題: Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis / Peize Liu, Zhe Tong, Chen Feng 他
日本語で読む → - 論文模倣学習ロボティクス
RayViT: 視点変動に頑健な模倣学習のためのレイ条件付き視覚表現
カメラの幾何情報を事前学習済みViTに注入する軽量アーキテクチャRayViTを提案し、カメラの摂動に対する模倣学習の頑健性を向上させた。
原題: RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning / Qian Wang, Longrui Chen, Peiran Sun 他
日本語で読む → - 論文手術ワークフローロボティクス
手術室ワークフローデータセットのための外科的再現手法
実際の手術室でのデータ収集が困難なため、再現された手術室で完全な手術手順を再現する方法論を提案し、反復可能でアノテーション可能なワークフローデータセットを作成する。
原題: Surgical Re-enactment for Operating Room Workflow Datasets / Jana Nina Friedrich, Andrea Karin Maria Ross, Angelo Henriques 他
日本語で読む → - 論文ヒューマノイド/接触制御ロボティクス
ContactMimic: 接触制御によるヒューマノイドの物体インタラクション
キーポイント追跡だけでは不十分な物体インタラクション(椅子に座る、黒板を拭くなど)に対し、接触コマンドを明示的に追跡する学習フレームワークを提案。接触追従報酬と軌道拡張により接触行動をキーポイント幾何から分離し、実世界で接触制御を実現した。
原題: ContactMimic: Humanoid Object Interaction via Contact Control / Xinyao Li, Xialin He, Runpei Dong 他
日本語で読む → - 論文把握検出/マルチモーダルロボティクス
Speech2Grasp: ヒューマノイドロボットにおけるテキスト条件付き把握検出の音声へのデータ効率的転移
テキスト条件付き把握検出モデルを音声入力に効率的に転移するフレームワークを提案し、実機ヒューマノイドでASRパイプラインより高性能かつ低遅延であることを示した。
原題: Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots / Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu 他
日本語で読む → - 論文マニピュレーションロボティクス
コートを着せる:微分可能な衣服シミュレーションを用いた双腕ロボットによる着衣支援
微分可能な衣服シミュレーションを統合した双腕ロボットの着衣制御アルゴリズムを提案し、接触拘束下での衣服状態を高精度に推定して多段階制御でコート着衣を実現した。
原題: Wearing A Coat: Dual-Arm Robot-Assisted Dressing with Differentiable Clothing Simulation / Yiming Liu, Lijun Han, Hesheng Wang
日本語で読む → - 論文操作学習/強化学習/Sim-to-Realロボティクス
ゼロショットSim-to-Real転送を備えたマルチタスクブロック押し操作のための単一拡散ポリシーコントローラ
強化学習を用いて、複数の形状のブロックを押すマルチタスク操作を単一の拡散ポリシーで学習し、実世界へゼロショット転送できることを示した論文。
原題: A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer / Haitong Ma, Haldun Balim, Yang Hu 他
日本語で読む → - 論文ROS 2 / ミドルウェアロボティクス
ROS 2ミドルウェアの三次元:空間・時間・状態の構造的限界
ROS 2のミドルウェア(DDSやZenoh)の構造的限界を、空間・時間・状態の3次元で分析する枠組みを提案し、既存研究を体系的に整理したサーベイ論文。
原題: The Three Dimensions of ROS 2 Middleware / Sanghoon Lee, Taehun Kim, Angelo Corsaro 他
日本語で読む → - 論文自動実験/自己運転ラボAI
検証ボトルネックの圧縮:科学的発見のためのエージェント型セルフドライビングラボ
実験検証のボトルネックを減らすため、事前知識を活用した実験計画と、低コスト測定から高コスト測定を予測するサロゲートモデルを組み合わせたエージェントを提案し、生物学と材料科学でのループ数とコスト削減を目指す。
原題: Compressing the Validation Bottleneck: An Agentic Self-Driving Lab for Scientific Discovery / Kyunghoon Hur, Chihun Lee
日本語で読む → - 論文遠隔操作ロボティクス
1D畳み込みニューラルネットワークを用いたsEMGベースの支援ロボットアームのリアルタイム遠隔操作
本論文は、4チャンネルの表面筋電図(sEMG)信号を1D CNNで分類し、支援ロボットアームをリアルタイムで遠隔操作するシステムを提案・評価した。
原題: Real-Time sEMG-Based Telecontrol of an Assistive Robotic Arm Using a 1D Convolutional Neural Network / Edgar Manacorda, Mena Samir Kama Abouseffien, Olivier Lecompte 他
日本語で読む → - 論文運転行動解析ロボティクス
シーン文脈下での都市減速行動モード:Argoverse 2 マルチエージェント軌跡からの初期運動学的分類器
都市部の減速イベントを運動学的特徴でクラスタリングし、4つの安定した行動モードを発見。初期1秒のデータからモードを予測する分類器を構築した。
原題: Urban Deceleration Behavior Modes Under Scene Context: An Early-Kinematic Classifier from Argoverse 2 Multi-Agent Trajectories / Eni Solomon Laughter
日本語で読む → - 論文プランニングロボティクス
不確実性下での仮説駆動型モデル拡張によるオープンワールドロボット計画
未知環境で動作するサービスロボットが、基盤モデルを用いて世界モデルの仮説を生成・検証・更新しながら自律的に知識を拡張し、タスク計画を実行する枠組みを提案した。
原題: Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning / Anxing Xiao, Hanbo Zhang, Tianrun Hu 他
日本語で読む → - 論文マニピュレーションロボティクス
衝突ベースの遅延探索による高速マルチマニピュレータ計画
複数マニピュレータの動作計画を高速化するため、遅延評価と事前計算を組み合わせた新しいアルゴリズムCBLSを提案した。
原題: Conflict-Based Lazy Search for Fast Multi-Manipulator Planning / Dongliang Zheng, Zhipeng Wang, Siqi Wang 他
日本語で読む → - 論文信頼性評価ロボティクス
信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
原題: Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels / Xinyu Yang, Tianxing Chen, Honghao Su 他
日本語で読む → - 論文マニピュレーションロボティクス
TACTIC: 触覚と視覚に基づく接触中心制御による全身マニピュレーション
全身マニピュレーションのための、RGB-D、分散触覚、2D近接表現を組み合わせた接触中心のハイブリッド予測モデルと、接触ヤコビアンを用いたサンプリングベースMPCを提案する。
原題: TACTIC: Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation / Rishabh Madan, Angchen Xie, Samantha Saak 他
日本語で読む → - 論文マニピュレーションロボティクス
AutoSpeed: 注釈不要の段階適応型動作速度学習によるロボット操作
操作タスクの各段階の難易度に応じて動作速度と予測時間を適応させる学習フレームワークを提案し、注釈なしで速度を調整し、タスク実行時間を短縮し成功率を向上させる。
原題: AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation / Qingda Hu, Ziheng Qiu, Jieru Zhao 他
日本語で読む → - 論文VLAロボティクス
解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデル
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
原題: Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models / Mingyang Sun, Jiude Wei, Xiujian Liang 他
日本語で読む → - 論文HRI/制御ロボティクス
信念を考慮した影響力と信頼(BAIT):繰り返しの人間とロボットの相互作用における人間の信念の形成
人間の信念の変化を推定しつつ、長期的な影響力と信頼のバランスを最適化する制御器BAITを提案し、シミュレーションと実機実験で有効性を示した。
原題: Belief-Aware Influence and Trust (BAIT): Shaping Human Belief During Repeated Human-Robot Interaction / Ye-Ji Mun, Mahsa Golchoubian, Shahabedin Sagheb 他
日本語で読む → - 論文ロバスト制御制御
GPU並列線形化誤差境界による非線形・ニューラルネットワーク動力学のリアルタイムロバスト最適制御
非線形およびニューラルネットワーク動力学の線形時変近似に対する厳密で微分可能な線形化誤差境界をGPU上で並列計算し、ロバスト制御のリアルタイム最適化を実現した。
原題: GPU-Parallel Linearization Error Bounds for Real-Time Robust Optimal Control of Nonlinear and Neural Network Dynamics / Jeffrey Fang, Keyi Shen, Anutam Srinivasan 他
日本語で読む → - 論文VLA/操作ロボティクス
SAM3Dガイドによる物体中心表現アライメントを用いた視覚言語行動モデル
VLAモデルにSAM3Dを教師として物体中心の3D表現を学習させ、推論時はRGBのみで高精度な操作を実現する手法を提案。
原題: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models / Zonghe Liu, Shanyuan Jie, Xiaoquan Sun 他
日本語で読む → - 論文位置認識ロボティクス
G-PROBE: 3D点群のためのクロスFOV位置認識と確信度結合型ローカライゼーション
限定的または非対称な視野角(FOV)でも動作する、学習不要のグローバル位置認識フレームワークG-PROBEを提案。仮想センサ分解と確信度マップを用いて、6自由度の姿勢推定までを統合する。
原題: G-PROBE: Cross-FOV Place Recognition and Certainty-Coupled Localization for 3D Point Clouds / Jinseop Lee
日本語で読む → - 論文世界モデル/計画ロボティクス
ActSWM: オープンワールドゲームにおける長期的計画のための行動感応型世界モデル
潜在世界モデルが長期的な行動計画で失敗する「コンテキスト崩壊」問題を特定し、行動感応性を制約として課す新しい世界モデルActSWMを提案した。Minecraftでの長期的計画やクロスゲームでの行動復元で性能を向上させた。
原題: ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games / Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng 他
日本語で読む → - 論文UAV/視覚AIロボティクス
低コストUAV向けリアルタイム視覚インテリジェンス:追跡・走査・ナビゲーションのためのモジュール式アプローチ
DJI Telloドローンを用いて、顔検出・認識・単眼深度推定を統合したモジュール式AIシステムを構築し、Webインターフェースで制御・監視できるようにした。低コスト・オープンソースで、人物追跡や屋内走査、自律ライン追従を実証した。
原題: Real-Time Visual Intelligence on Low-Cost UAVs: A Modular Approach for Tracking, Scanning, and Navigation / Andrei-Marian Ungureanu, Stelian Spînu
日本語で読む →