論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/8 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文触覚ロボティクス
BIFTA: 脳に着想を得た未知触覚センサへの少数ショット適応
未知の触覚センサに対して、凍結したエンコーダを少数のラベル付きデータで適応させる脳 inspired フレームワークを提案し、既存手法を大幅に上回る精度向上を達成した。
原題: BIFTA: Brain-Inspired Few-Shot Tactile Adaptation for Unknown Sensors / Boheng Liu, Ziyu Li, Xia Wu
日本語で読む → - 論文検証器ロボティクス
無料の検証器は存在しない:ロボット政策の検証器に関するサーベイ
ロボット政策の検証器約150件を、判定の入手しやすさと信頼性のトレードオフの観点から分類・比較したサーベイ。
原題: No Free Checker: A Survey of Verifiers for Robot Policies / Yang Wan, Xihang Yue, Zhirui Liu 他
日本語で読む → - 論文デジタルツイン/エージェントAIロボティクス
再構成可能な製造のための認知デジタルツインのエージェントAIによるセマンティックコミッショニング
マルチエージェントAIとRAG・MCPを組み合わせ、認知デジタルツインの構築・デバッグを自動化し、展開時間を数週間から約2時間に短縮した。
原題: Agentic AI-enabled Semantic Commissioning of a Cognitive Digital Twin for Reconfigurable Manufacturing / Yangyang Liu, Xun Xu, Jan Polzer
日本語で読む → - 論文RPA/プロセス自動化AI
医療プロセスにおけるRPA機会の特定と優先順位付けのためのデータ駆動型フレームワーク
病院の事務負担を軽減するRPA導入において、プロセス選定を体系的に行うための4モジュールからなるデータ駆動型フレームワークを提案し、合成データでその有効性を検証した。
原題: A Data-Driven Framework for Identifying and Prioritizing RPA Opportunities in Healthcare Processes / Maria Alejandra Gomez, Juan Manuel Castillo
日本語で読む → - 論文自動運転/知覚ロボティクス
自動運転レースにおけるマルチモーダル知覚パイプラインによる物体検出と追跡
自動運転レース向けに、カメラ・LiDAR・RADARの検出結果を後期融合し、遅延補償と車両ダイナミクス・コース知識を組み込んだ追跡フレームワークを提案した。実データ評価で有効性を確認した。
原題: A Multi-Modal Perception Pipeline for Object Detection and Tracking in Autonomous Racing / Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli 他
日本語で読む → - 論文視覚運動ポリシーロボティクス
フォーカスプーリングによる局所視覚特徴の集約と視覚運動ポリシーへの応用
CNNの中間特徴から制御に重要な局所情報を選択的に集約するFocusPoolを提案し、シミュレーションと実機で成功率を大幅に向上させた。
原題: Localized Visual Feature Aggregation via Focus Pooling for Visuomotor Policies / Ruiyu Wang, Zheyu Zhuang, Danica Kragic 他
日本語で読む → - 論文能動視覚/手内操作/3D再構成ロボティクス
AURORA: 能動的不確実性駆動の手内再方向付けによる物体再構成
ロボットハンドに把持された物体の隠れた表面を効率的に観測するため、再構成の不確実性に基づいて次の視点を選び、手内回転を能動的に制御する3D再構成フレームワークを提案した。
原題: AURORA: Active Uncertainty-Driven Re-Orientation for In-Hand Reconstruction / Feiyu Zhao, Yuetong Li, Chenxi Xiao
日本語で読む → - 論文3Dシーン理解画像認識
Spheriverse: 実世界の球面観測による3Dシーン理解
球面画像とLiDARの大規模データセットを構築し、球面幾何を考慮した占有予測フレームワークSphereOccを提案して、セマンティック占有予測や3D物体検出のベンチマークで優れた性能を示した。
原題: Spheriverse: 3D Scene Understanding from Spherical Observations in the Wild / Fei Teng, Sheng Wu, Mengfei Duan 他
日本語で読む → - 論文ナビゲーション画像認識
AirAnchor:ゼロショット空中視覚言語ナビゲーションのための局所・大域空間情報の橋渡し
ドローンによる空中視覚言語ナビゲーションにおいて、局所空間情報と大域空間情報を空間アンカーで橋渡しし、統合フレームワークで意思決定を行う手法を提案した。実験で既存のゼロショット手法を大幅に上回る性能を示した。
原題: AirAnchor: Bridging Local and Global Spatial Information for Zero-Shot Aerial Vision-and-Language Navigation / Shanwei Fan, Bin Zhang, Zhiwei Xu 他
日本語で読む → - 論文群制御制御
有向グラフ上の安全協調のためのネットワーク化許容性保持制御
有向通信グラフで結ばれたエージェント群が、共通の移動安全領域と異種非対称入力制約の下で協調するための制御則を提案し、指数収束と安全性を保証する。
原題: Networked Admissibility-Preserving Control for Directed Safe Coordination / Abhinav Sinha, Lohitvel Gopikannan, Shashi Ranjan Kumar
日本語で読む → - 論文データセット/マルチモーダルロボティクス
DYAD: 共在する人間支援のマルチモーダルデータセット
ギアボックス組立作業中に、訓練されたヘルパーがHoloLens 2装着者を支援する際の、言語的・物理的介入と作業者の要求・タスク状態・結果を同期記録したデータセットを構築し、支援プロセスの因果理解・モード予測・応答生成のベンチマークを提供した。
原題: DYAD: A Multimodal Dataset of Co-Located Human Assistance / Akhil Ajikumar, Mahya Qorbani, Sakib Reza 他
日本語で読む → - 論文対話管理ロボティクス
HiBRIDGE: グループロボット対話管理のための解釈可能な階層ベイズニューラルネットワークフレームワーク
複数人との対話において、ロボットが誰に話しかけ何を言うかを決定する際の不確実性を扱うため、階層ベイズニューラルネットワークを用いた対話管理フレームワークを提案し、解釈可能性も向上させた。
原題: HiBRIDGE: A Hierarchical Bayesian Neural Network Framework for Interpretable Dialogue Management in Group-Robot Interaction / Massimiliano Nigro, Hatice Gunes, Micol Spitale 他
日本語で読む → - 論文物理推論ロボティクス
CALIPER:クリーンなシーンでは事前学習済み視覚表現の物理推論を評価できない
事前学習済み視覚エンコーダの物理推論能力を評価する新しい手法CALIPERを提案し、固定カメラのクリーンなシーンでは既存の評価が物理推論を正しく区別できないことを示した。
原題: CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations / Aman Mehta, Riya Baviskar
日本語で読む → - 論文強化学習機械学習
SUN: 強化学習における新規性への到達
強化学習の探索において、新規性と到達可能性を同時に考慮した目標選択フレームワークSUNを提案し、到達不能な状態を含む環境で既存手法を上回る性能を示した。
原題: SUN: Reaching for Novelty in Reinforcement Learning / Wenyan Yang, Arsenii Mustafin, Dominik Baumann 他
日本語で読む → - 論文自動運転/LLMエージェント/テストAI
PlannerForge: 自動運転におけるモーションプランナーのシナリオベーステストのためのLLMエージェント
自動運転システムのシナリオベーステストの全工程を統一的なLLMエージェントフレームワークで統合し、シナリオ生成から評価、さらにはシステム改善とベンチマークまでを自動化するPlannerForgeを提案した。
原題: PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving / Yuan Gao, Sebastian Müller, Mattia Piccinini 他
日本語で読む → - 論文手術ロボティクスロボティクス
手動操作と遠隔操作による眼内器具動作の比較:入力デバイスの評価
ロボット支援顕微手術の入力デバイスが外科医の技術を保持するか検証するため、同一条件下で手動と遠隔操作の眼内器具動作を比較し、遠隔操作では時間が3倍、動作分割が3.5倍になるなど実行特性が変化することを示した。
原題: A Controlled Comparison of Manual and Teleoperated Intraocular Instrument Motion for an Input Device / Korab Hoxha, Mirza Imamovic, Angelo Henriques 他
日本語で読む → - 論文sim2realロボティクス
脚式ロボット学習における狭可生存性タスクのためのアクチュエータダイナミクスカリキュラム
関節剛性を高く初期化し、エピソード完了長に応じて同定値まで徐々に下げるカリキュラムを提案し、Spotの四足から逆立ちへの遷移など探索が終了条件で妨げられるタスクの学習を可能にした。
原題: Actuator Dynamics Curricula for Narrow-Viability Tasks in Legged Robot Learning / Kousheek Chakraborty, Chandan K. Rajendra, Ayham Alharbat 他
日本語で読む → - 論文SLAMロボティクス
MFVINS: 複数魚眼カメラを用いた視覚慣性システム
複数の魚眼カメラとIMUを統合したSLAMシステムを提案し、単眼カメラの問題(遮蔽や照明変化、テクスチャレス環境での誤差蓄積)を改善。IMU支援の特徴追跡と学習ベースの深度推定を用いた再投影誤差により、リアルタイムで高精度な姿勢推定を実現。
原題: MFVINS: Multiple Fisheye Camera-Based Visual Inertial System / Eunseong Jang, YuJin Chung, Sang Jun Lee 他
日本語で読む → - 論文模倣学習/ベンチマークロボティクス
猿は見て学べるか?ロボットの観察によるスキル学習を評価するベンチマーク
人間の動画からロボットが操作スキルを学習する際の評価を統一するため、10種類の操作タスクを含むベンチマーク「RoboReel」を提案し、複数の最先端アルゴリズムを比較分析した。
原題: Monkey See, Can Monkey Do? A Benchmark for Evaluating Robot Skill Learning by Observation / Weiwei Gu, Anmol Gupta, Anant Sah 他
日本語で読む → - 論文シミュレーションロボティクス
Ostrich: 微分可能ダイナミクスにおける剛直な接触を跨ぐ大きな歩幅
硬い接触と摩擦を大きなタイムステップで解くGPU加速剛体シミュレータを提案し、暗黙関数定理による微分でメモリ効率よく勾配を計算する。実ロボット軌道でMuJoCoの精度を維持しつつ、勾配最適化の収束性と速度を大幅に向上させた。
原題: Ostrich: Taking Large Strides Through Stiff Contact in Differentiable Dynamics / Aleš Kučera, Karel Zimmermann
日本語で読む → - 論文被覆経路計画ロボティクス
冗長マニピュレータのための一般化スパニングツリーを用いた被覆経路計画
冗長マニピュレータの表面被覆問題に対し、各セルの複数の逆運動学解を考慮したオフライン・オンラインのスパニングツリー被覆アルゴリズムを提案し、計算時間と関節動作を削減する。
原題: Coverage Path Planning for Redundant Manipulators using Generalized Spanning Trees / Raksi Kopo, Kostas J. Kyriakopoulos
日本語で読む → - 論文歩行ロボティクス
PGMT: 人型ロボットのための知覚的汎用動作追跡
複雑な地形でも動作追跡を可能にする、地形認識を組み込んだ人型ロボット用のパイプラインを提案。実機で37cmの障害物を越える適応的歩行と全身動作を実現した。
原題: PGMT: Perceptive General Motion Tracking for Humanoid Robots / Hongyi Li, Li Peizhuo, Yucheng Tao 他
日本語で読む → - 論文位置推定画像認識
重力整列ワイヤーフレームによる深度不要の単眼フロアプラン位置推定
深度予測の代わりに重力整列ワイヤーフレームを用いて、単眼RGB画像からフロアプランに対するカメラ位置を推定する新しい手法を提案した。
原題: GALoc: Gravity Aligned Wireframes for Depth-Free Monocular Floorplan Localization / Jeahn Han, Minji Kim, Jeongbin Sohn 他
日本語で読む → - 論文自律探索ロボティクス
TASG-Explore: 不整地における地上ロボットのための走破性を考慮したセクタ誘導探索
不整地での自律探索において、効率・網羅性・安全性を両立するため、階層的走破性解析とセクタ誘導プランナを組み合わせた探索フレームワークを提案した。
原題: TASG-Explore: Traversability-Aware Sector-Guided Exploration for Ground Robot on Uneven Terrain / Shaocong Wang, Shiliang Shao, Ting Wang 他
日本語で読む → - 論文強化学習機械学習
SACにおけるtanhヤコビアンの解放:バンバン制御とMetaDriveに関する負の結果
SACのtanh圧縮による勾配消失を補正するバイパスを試したが、極端な行動が最適なタスクでも性能改善は見られず、むしろ悪化することを示した負の結果。
原題: Unthrottling the Tanh Jacobian in SAC: A Negative Result on Bang-Bang Control and MetaDrive / Faiq Shamass
日本語で読む → - 論文モデルベース強化学習ロボティクス
CAST: 交互状態価値目標と拡張方策勾配によるモデルベース強化学習
モデルベース強化学習において、プランナー誘導行動と現在の方策を交互に用いた状態価値目標を導入し、価値学習を改善する手法CASTを提案。シミュレーションと実機の四足ロボットで有効性を実証。
原題: CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning / Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard 他
日本語で読む → - 論文タスク計画ロボティクス
具現化エージェントのための長期グラフメモリを用いた安全なタスク計画
LLM/VLMによるタスク計画に、環境の長期意味グラフメモリを組み合わせ、物理的リスクを予測して安全な行動を計画するフレームワークSafeMemを提案した。
原題: Safe Task Planning with Long-Term Graph Memory for Embodied Agents / Siyuan Li, Taiyan Lang, Aoqi Yan 他
日本語で読む → - 論文ワールドモデル/シミュレーション画像認識
SyncWorld: 視覚キャリブレーションによるワールドモデルのゼロショットシミュレータ化
ロボットの行動と視覚変化の対応を視覚キャリブレーションで文脈的に指定することで、未見環境でも追加学習なしに行動結果を正確にシミュレートできるワールドモデルを提案した。
原題: SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators / Yuncong Yang, Zhengtao Han, Furkan Ozyurt 他
日本語で読む → - 論文運転支援画像認識
警告前に観察せよ:視覚言語モデルによる適応的ドライバー警告
ドライバー向けの警告タイミングを、沈黙・観察・警告の3アクションとしてモデル化し、視覚言語モデルで危険性を推定して適応的に警告するフレームワークを提案した。
原題: Observe Before You Alert: Adaptive Driver Alerting with Vision-Language Models / Yuhang Wang, Lingyao Li, Hao Zhou
日本語で読む → - 論文マニピュレーションロボティクス
CASD: チャンク整合セマンティック蒸留による多段階ロボット操作
行動チャンク全体に対するセマンティックな目標を生成し、ポリシー学習を改善する手法を提案。オフラインVLMでデモを段階に分割し、その重み付き目標を予測するジェネレータを訓練し、ポリシーを条件付けする。
原題: CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation / Tinghe Ding, Jiahao Li, He Wang
日本語で読む →