論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/9 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
HuRo: 人間動画をロボット化してスケーラブルなVLA事前学習を実現
人間の動画をロボットの観測と行動軌跡に変換するパイプラインを構築し、約63万エピソードのデータセットでVLAポリシーを事前学習することで、実世界の操作タスクの成功率とOOD汎化性能を大幅に向上させた。
原題: HuRo: Robotizing Human Videos for Scalable VLA Pretraining / Jinho Jeong, Se June Joo, Jaehyun Kang 他
日本語で読む → - 論文探査計画ロボティクス
情報の価値はリスクに見合うか:危険環境ロボット探査のための行動的評価
危険環境でのロボット探査において、情報獲得のリスクを考慮して経路を評価するPrelec確率重み付けに基づく行動的情報評価手法を提案し、情報とリスクのトレードオフ構造を理論的・実験的に示した。
原題: When Information is Worth the Risk: Behavioral Valuation for Hazardous Robotic Exploration / Alkesh K. Srivastava, Aamodh Suresh, Carlos Nieto-Granda 他
日本語で読む → - 論文フィジカルAIAI
フィジカルAIの能力形成における7つの源泉
フィジカルAIの能力がどのように形成されるかを整理し、記録経験・予測モデリング・評価的相互作用・代理環境・機構基盤・身体結合・進化駆動という7つの非排他的な源泉を提唱した論文。
原題: Seven Sources of Physical AI Capability Formation / Gang Chen
日本語で読む → - 論文セマンティックセグメンテーション画像認識
CLFTv2: 階層的特徴ピラミッドによる効率的なカメラ-LiDAR融合セマンティックセグメンテーション
Swinベースのマルチスケールエンコーダと軽量FPNデコーダでカメラとLiDARを融合し、自動運転のセマンティックセグメンテーションを高効率・高精度に実現した研究。
原題: CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids / Toomas Tahves, Mauro Bellone, Raivo Sell
日本語で読む → - 論文模倣学習cs.GR
InstantMimic: 物理ベーススキルを数秒で学習する高性能システム
強化学習による物理ベースキャラクタ制御の学習ループ全体をGPU上で完結させ、多様なスキルを数秒で学習可能にしたシステム。
原題: InstantMimic: A High Performance System for Learning Physics-based Skills in Seconds / Ikjun Choi, Geonho Leem, Jungdam Won
日本語で読む → - 論文連合学習セキュリティ機械学習
連合学習におけるLT符号に着想を得たピーリングによる勾配逆転の連鎖
連合学習の勾配逆転攻撃を消失訂正符号の理論と結びつけ、単一ラウンドでバッチを完全復元する新手法を提案し、従来の限界を大幅に超えることを示した。
原題: Cascading Gradient Inversion via LT-Code Inspired Peeling in Federated Learning / Saeed Shariati, Mohsen Alambardar Meybodi
日本語で読む → - 論文動作計画ロボティクス
PccDiffuser: 連続体ロボットのためのマルチソリューション動作計画
連続体ロボットの経路計画において、条件付き拡散モデルを用いて複数の候補解を並列生成し、アクチュエータ制約を考慮した軌道に変換する手法を提案。障害物0〜4個の環境で91%の成功率を達成し、従来手法より高成功率かつ高効率であることを示した。
原題: PccDiffuser: Multi-solution Motion Planning for Continuum Robots / Ke Qiu, Sifan Chen, Si Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
表現豊かなロボットピアニスト:グラフ模倣と音楽的ダイナミクスで複雑なピアノ曲を演奏
強化学習とグラフベースの運指最適化、物理に基づく音響モデルを組み合わせ、人間らしい表現力で多様なピアノ曲を演奏できるロボットハンドを実現した。
原題: Expressive Robotic Pianist: Mastering Complex Piano Repertoire with Graph-Mimic and Musical Dynamics / Yanhong Liang, Xianwei Liu, Chaojie Fu 他
日本語で読む → - 論文VLAeess.SP
6Gにおけるプライバシー保護型身体知能のためのモダリティ分離連合学習
VLAモデルの連合学習において、視覚・言語・行動の各モダリティ特性に応じて集約・プライバシー配分・通信圧縮を分離設計し、6G網でのロボット協調を効率化するフレームワークを提案。
原題: Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6G / Zhuodong Liu, Xiangyu Li, Chunhong Yuan 他
日本語で読む → - 論文群制御ロボティクス
狭い産業環境における大型異種車両のための交通管理システム
NURBS曲線で生成したロードマップ上でL-MAPFアルゴリズムを動作させ、大型で異種なAGVの安全な協調を保証する交通管理システムを提案した。
原題: A traffic management system for large and heterogeneous vehicles in narrow industrial environments / Alessandro Bonetti, Silvia Proia, Simone Guidetti 他
日本語で読む → - 論文マルチエージェント強化学習ロボティクス
山火事対応における自律UAV探査のためのマルチエージェント強化学習
深層強化学習を用いてUAVエージェントが模擬山火事環境を航行・監視する枠組みを開発し、学習の安定化と火災境界追跡などの有効な行動獲得を示した。
原題: Multi-Agent Reinforcement Learning for Autonomous UAV Exploration in Wildfire Response / Caden Chandra, Jerry Ng
日本語で読む → - 論文マニピュレーションロボティクス
GTA-2: 接地されたタスク軸によるロボットマニピュレーションスキル合成のためのマルチVLMフレームワーク
4つのVLMエージェントがタスクを分解し、キーポイントや軸・制御パラメータを接地させて、実機ロボットのマニピュレーションスキルをゼロショットで生成するフレームワーク。
原題: GTA-2: A Multi-VLM Framework for Synthesizing Robot Manipulation Skills via Grounded Task Axes / M. Yunus Seker, Shobhit Aggarwal, Ruwan Wickramarachchi 他
日本語で読む → - 論文VLAロボティクス
周波数条件付きフローマッチングによる視覚-言語-行動モデル
VLAモデルの行動生成をDCT周波数座標で行い、周波数ごとに条件付け・重み付けするFreqFMを提案。LIBERO等で性能向上と実機6タスクでの有効性を示した。
原題: Frequency-Conditioned Flow Matching for Vision-Language-Action Models / Haochen Niu, Shengye Dong, Hao Liu 他
日本語で読む → - 論文模倣学習ロボティクス
JEPAポリシー:ペア行動と未来表現予測による拡散不要の模倣学習
行動チャンクとその未来表現をペアで学習する拡散不要の模倣学習フレームワークを提案し、9つのシミュレーションタスクと実機実験で成功率向上と低遅延を実現した。
原題: JEPA Policy: Diffusion-Free Imitation Learning via Paired Action and Future Representation Prediction / Jie Xu, Kangjin Yu, Ziyi Jin 他
日本語で読む → - 論文VLAロボティクス
CT-SAFR: 自律ロボットのための安全で解釈可能な連鎖推論 — 信頼できるAI駆動型ロボット意思決定のための多層検証フレームワーク
LLMの連鎖推論を用いたロボットの意思決定において、幻覚を94.2%検出し不安全な推論出力を87%削減する多層検証フレームワークを提案した。
原題: CT-SAFR: Safe and Interpretable Chain-of-Thought Reasoning for Autonomous Robots: A Multi-Layered Verification Framework for Trustworthy AI-Driven Robotic Decision Making / Cagri Temel
日本語で読む → - 論文対話型AI・デジタルヒューマン画像認識
生きた図書館:アーカイブコレクションを対話型知識システムへ変える ― セオドア・ルーズベルト大統領図書館での実践から
断片化したデジタルアーカイブを、統治された対話型の展示体験へと変換する4層フレームワークを構築し、ルーズベルト大統領図書館で実運用した。
原題: The Living Library: Transforming Archival Collections into Conversational Knowledge Systems -- Lessons from the Theodore Roosevelt Presidential Library / Pengce Wang, Lucia Ronchi Darre, Matt Briney 他
日本語で読む → - 論文SLAMロボティクス
MFVINS: 複数魚眼カメラを用いた視覚慣性システム
複数の魚眼カメラとIMUを統合したSLAMシステムを提案し、単眼カメラの問題(遮蔽や照明変化、テクスチャレス環境での誤差蓄積)を改善。IMU支援の特徴追跡と学習ベースの深度推定を用いた再投影誤差により、リアルタイムで高精度な姿勢推定を実現。
原題: MFVINS: Multiple Fisheye Camera-Based Visual Inertial System / Eunseong Jang, YuJin Chung, Sang Jun Lee 他
日本語で読む → - 論文動作予測画像認識
どこからどのようにへ:自己中心視点ビデオからの連続4Dインタラクション予測
自己中心視点ビデオから将来の3Dインタラクション位置と全身動作を連続的に予測する手法を提案し、大規模データセットと評価指標も導入した。
原題: From Where to How: Continuous 4D Interaction Forecasting from Egocentric Video / Qiaohui Chu, Haoyu Zhang, Meng Liu 他
日本語で読む → - 論文手術ロボティクスロボティクス
手動操作と遠隔操作による眼内器具動作の比較:入力デバイスの評価
ロボット支援顕微手術の入力デバイスが外科医の技術を保持するか検証するため、同一条件下で手動と遠隔操作の眼内器具動作を比較し、遠隔操作では時間が3倍、動作分割が3.5倍になるなど実行特性が変化することを示した。
原題: A Controlled Comparison of Manual and Teleoperated Intraocular Instrument Motion for an Input Device / Korab Hoxha, Mirza Imamovic, Angelo Henriques 他
日本語で読む → - 論文走行可能性解析ロボティクス
ガウス文脈分布による意味的曖昧性推定に基づくVLM駆動走行可能性解析
VLMの予測をガウス分布としてモデル化し、不確実性マップを生成することで、屋外環境での安全な自律走行を実現する手法を提案した。
原題: Estimating Semantic Ambiguity via Gaussian Context Distributions for VLM-Driven Traversability Analysis / Ramona Häuselmann, Mario A. V. Saucedo, Christoforos Kanellakis 他
日本語で読む → - 論文位置認識画像認識
DXPR: 視覚基盤モデルを用いた深度ベースの視覚-LiDARクロスモーダル位置認識
カメラ画像とLiDARスキャンを統一的な深度画像に変換し、視覚基盤モデルを用いてモダリティ非依存のグローバル記述子を学習することで、事前構築されたLiDARマップ内でのカメラのみによるロバストな位置認識を実現する。
原題: DXPR: Depth-Based Vision-LiDAR Cross-Modal Place Recognition Using Vision Foundation Models / Yungsoo Han, Youngseok Jang, Seungwon Roh 他
日本語で読む → - 論文sim2realロボティクス
脚式ロボット学習における狭可生存性タスクのためのアクチュエータダイナミクスカリキュラム
関節剛性を高く初期化し、エピソード完了長に応じて同定値まで徐々に下げるカリキュラムを提案し、Spotの四足から逆立ちへの遷移など探索が終了条件で妨げられるタスクの学習を可能にした。
原題: Actuator Dynamics Curricula for Narrow-Viability Tasks in Legged Robot Learning / Kousheek Chakraborty, Chandan K. Rajendra, Ayham Alharbat 他
日本語で読む → - 論文RPA/プロセス自動化AI
医療プロセスにおけるRPA機会の特定と優先順位付けのためのデータ駆動型フレームワーク
病院の事務負担を軽減するRPA導入において、プロセス選定を体系的に行うための4モジュールからなるデータ駆動型フレームワークを提案し、合成データでその有効性を検証した。
原題: A Data-Driven Framework for Identifying and Prioritizing RPA Opportunities in Healthcare Processes / Maria Alejandra Gomez, Juan Manuel Castillo
日本語で読む → - 論文自律探索ロボティクス
TASG-Explore: 不整地における地上ロボットのための走破性を考慮したセクタ誘導探索
不整地での自律探索において、効率・網羅性・安全性を両立するため、階層的走破性解析とセクタ誘導プランナを組み合わせた探索フレームワークを提案した。
原題: TASG-Explore: Traversability-Aware Sector-Guided Exploration for Ground Robot on Uneven Terrain / Shaocong Wang, Shiliang Shao, Ting Wang 他
日本語で読む → - 論文被覆経路計画ロボティクス
冗長マニピュレータのための一般化スパニングツリーを用いた被覆経路計画
冗長マニピュレータの表面被覆問題に対し、各セルの複数の逆運動学解を考慮したオフライン・オンラインのスパニングツリー被覆アルゴリズムを提案し、計算時間と関節動作を削減する。
原題: Coverage Path Planning for Redundant Manipulators using Generalized Spanning Trees / Raksi Kopo, Kostas J. Kyriakopoulos
日本語で読む → - 論文歩行ロボティクス
PGMT: 人型ロボットのための知覚的汎用動作追跡
複雑な地形でも動作追跡を可能にする、地形認識を組み込んだ人型ロボット用のパイプラインを提案。実機で37cmの障害物を越える適応的歩行と全身動作を実現した。
原題: PGMT: Perceptive General Motion Tracking for Humanoid Robots / Hongyi Li, Li Peizhuo, Yucheng Tao 他
日本語で読む → - 論文自動運転/知覚ロボティクス
自動運転レースにおけるマルチモーダル知覚パイプラインによる物体検出と追跡
自動運転レース向けに、カメラ・LiDAR・RADARの検出結果を後期融合し、遅延補償と車両ダイナミクス・コース知識を組み込んだ追跡フレームワークを提案した。実データ評価で有効性を確認した。
原題: A Multi-Modal Perception Pipeline for Object Detection and Tracking in Autonomous Racing / Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli 他
日本語で読む → - 論文マニピュレーションロボティクス
FOCIポリシー:関係的操作ポリシーのためのオブジェクト中心相互作用に焦点を当てる
物体間の相対運動に基づく相互作用中心のフレームワークを提案し、デモから重要な相互作用区間を抽出してスキルを表現することで、少ないデータで高い性能を達成する操作ポリシーを開発した。
原題: FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies / Ze Fu, Pinhao Song, Yutong Hu 他
日本語で読む → - 論文通信/ロボット動作ロボティクス
動作による遠隔検出可能な鍵付き通信
ロボットの動作にメッセージをノイズとして埋め込み、遠隔センシングで検出可能な通信手法を提案。ポリシー性能を損なわずに短いペイロードを送信できる。
原題: Remotely Detectable Keyed Communication through Motion / Benjamin Chang, Michael Amir, Manon Flageat 他
日本語で読む → - 論文対話管理ロボティクス
HiBRIDGE: グループロボット対話管理のための解釈可能な階層ベイズニューラルネットワークフレームワーク
複数人との対話において、ロボットが誰に話しかけ何を言うかを決定する際の不確実性を扱うため、階層ベイズニューラルネットワークを用いた対話管理フレームワークを提案し、解釈可能性も向上させた。
原題: HiBRIDGE: A Hierarchical Bayesian Neural Network Framework for Interpretable Dialogue Management in Group-Robot Interaction / Massimiliano Nigro, Hatice Gunes, Micol Spitale 他
日本語で読む →