論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
GEM-4D: ロボット操作のための幾何学強化ビデオワールドモデル
ビデオ生成モデルに4次元対応関係の教師信号を注入し、外観と幾何構造を同時に学習させることで、物理的に一貫した未来予測とロボット操作への直接適用を可能にした。
原題: GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation / Kaichen Zhou, Yuzhen Chen, Fangneng Zhan 他
日本語で読む → - 論文群制御ロボティクス
張力-推力フィードフォワードによる受動的耐故障性:ケーブル切断を伴う分散型マルチUAV吊荷輸送のハイブリッド入力-状態安定性
マルチUAV吊荷輸送中にケーブルが突然切断された際、各機体の張力計測値を直接推力指令にフィードバックする受動的アーキテクチャを提案し、切断後の回復を理論的に保証する。5機・10kgペイロードのシミュレーションで有効性を実証した。
原題: Passive Fault Tolerance through Tension-to-Thrust Feed-Forward: Hybrid Input-to-State Stability for Decentralized Multi-UAV Slung-Load Transport under Abrupt Cable Severance / Hadi Hajieghrary, Paul Schmitt
日本語で読む → - 論文VLAロボティクス
GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
原題: GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization / Xiaosong Jia, Bowen Yang, Zuhao Ge 他
日本語で読む → - 論文ナビゲーション支援ロボティクス
CANINE: 視覚障害者へのロボット盲導犬を用いた対話的ナビゲーションのコーチング
視覚障害者がロボット盲導犬と協調してナビゲーションするスキルを、個別適応的な音声フィードバックで自動コーチングするシステムを提案し、実験で学習効率と最終性能の向上を実証した。
原題: CANINE: Coaching Visually Impaired Users for Interactive Navigation with a Robot Guide Dog / Cunjun Yu, Zishuo Wang, Anxing Xiao 他
日本語で読む → - 論文テレプレゼンスロボットHCI
在宅のK-12生徒4名を対象としたテレプレゼンスロボットの複数週間にわたる教室展開:利点、課題、および推奨事項
在宅のK-12生徒がテレプレゼンスロボットを使って教室に参加した複数週間の実践を4件のケーススタディとして分析し、利点と課題を明らかにした。
原題: Multi-Week, In-Class Deployments of Telepresence Robots With Four Homebound K-12 Students: Benefits, Challenges, and Recommendations / Matthew Rueben, Rhianna Lee, Thomas R. Groechel 他
日本語で読む → - 論文視線推定画像認識
Gaze4HRI: 人間ロボット相互作用のための視線推定ニューラルネットワークのゼロショットベンチマーク
人間ロボット相互作用における視線推定の頑健性を評価する大規模データセットとベンチマークを提案し、既存手法が特定条件下で失敗することを明らかにした。
原題: Gaze4HRI: Zero-shot Benchmarking Gaze Estimation Neural-Networks for Human-Robot Interaction / Berk Sezer, Ali Görkem Küçük, Erol Şahin 他
日本語で読む → - 論文探索ロボティクス
段階的到達可能グラフと構造事前情報を用いた地上ロボットの多階探索
多階建物内での地上ロボットの自律探索を、到達可能な支持面を表す疎なグラフを段階的に構築し、階間の接続性を仮説的に保持することで効率的に行う手法を提案した。
原題: Multi-Floor Exploration for Ground Robots via an Incremental Reachable Graph and Structural Priors / Zhiwen Zhu, Jiaqi Chen, Xiangyi Huang 他
日本語で読む → - 論文医療ロボティクスロボティクス
解剖学的ランドマーク誘導による深層強化学習を用いた自律的胃内ナビゲーション
カプセル内視鏡の胃内ナビゲーションを、解剖学的ランドマークを利用した深層強化学習で自律化し、シミュレーションと実環境で高い被覆率と短時間化を達成した。
原題: Anatomical Landmark-Guided Deep Reinforcement Learning for Autonomous Gastric Navigation / Haoxuan Wu, Sishen Yuan, Haitao Gao 他
日本語で読む → - 論文群制御ロボティクス
トポロジー駆動型ソフトロボットの絡まり防止制御
複数のソフトロボットが絡まらないように、トポロジー情報を活用したマルチエージェント強化学習フレームワークを提案した論文。
原題: Topology-Driven Anti-Entanglement Control for Soft Robots / Haoyang Le, Shengxuan Wang, Mohan Chen 他
日本語で読む → - 論文ロボット操作cs.CR
求めていたものではない:家庭用ロボット操作におけるタイポグラフィ攻撃
家庭用ロボットの操作パイプライン全体に対するタイポグラフィ攻撃の影響を、HabitatシミュレーションとHomeRobotベンチマークで評価し、攻撃成功率67.8%で誤った物体を物理的に掴んで運ぶことを実証した。
原題: Not What You Asked For: Typographic Attacks in Household Robot Manipulation / Ali Iranmanesh, Peng Liu
日本語で読む → - 論文ナビゲーションロボティクス
隔離を超えて:汎用ナビゲーションのための統一ベンチマーク
多様なロボット形態と複合的なナビゲーションタスクを統合したベンチマークOmniNavBenchを提案し、既存手法の汎用ナビゲーション能力の限界を明らかにした。
原題: Beyond Isolation: A Unified Benchmark for General-Purpose Navigation / Samson Sun, Tianyi Yang, Tengyue Wang 他
日本語で読む → - 論文VLAAI
視点計画:VLMによる3D空間の能動的推論と計画
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
原題: Planning with the Views / Kangrui Wang, Linjie Li, Zhengyuan Yang 他
日本語で読む → - 論文医療ロボティクスロボティクス
自己感知型腱ループによる腱-シース機構のヒステリシスモデリングと補償
柔軟内視鏡ロボットの腱-シース機構における構成依存のヒステリシスを、近位側で張力を計測できる二重ループ構造(SSTL)を用いて学習ベースで推定し、フィードフォワード制御で補償する手法を提案した。
原題: SSTL: Self-Sensing Tendon Loop for Hysteresis Modeling and Compensation in Tendon-Sheath Mechanisms / Myeongbo Park, Junhyun Park, Ihsan Ullah 他
日本語で読む → - 論文データセットロボティクス
SteelDS: 高解像度E40鋼スクラップビデオデータセット - 物体検出とインスタンスセグメンテーション用
コンベア上の鋼と銅スクラップの高解像度ビデオデータセットを提供し、材料分類・物体検出・インスタンスセグメンテーションのモデル開発を支援する。
原題: SteelDS: A High-Resolution Video Dataset of E40 Steel Scrap for Object Detection and Instance Segmentation / Melanie Neubauer, Christian Rauch, Gerald Koinig 他
日本語で読む → - 論文ナビゲーションロボティクス
アクションエージェント:エージェント型ビデオ生成とフロー制約拡散の融合
LLMによるビデオ生成とフロー制約拡散モデルを組み合わせ、複数のロボット形態でナビゲーションを実現する2段階フレームワークを提案した。
原題: Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion / Jeffrin Sam, Nguyen Khang, Yara Mahmoud 他
日本語で読む → - 論文世界モデル機械学習
UWM-JEPA: 信念空間で想像する予測的世界モデル
部分観測環境向けに、密度行列潜在変数とユニタリ予測器を持つJEPA世界モデルを提案し、隠れ状態の不確実性を保持したままロールアウトできることを示した。
原題: UWM-JEPA: Predictive World Models That Imagine in Belief Space / Santosh Kumar Radha, Oktay Goktas
日本語で読む → - 論文自動運転/軌道計画/制御ロボティクス
限界領域での軌道計画と制御:RoboRacerプラットフォームにおけるオープンな実験ベンチマーク
高加速度走行を限界まで押し上げる軌道計画・制御手法を評価するモジュール式フレームワークを提案し、1/10スケールのRoboRacerプラットフォームで実証した。
原題: Trajectory Planning and Control near the Limits: an Open Experimental Benchmark on the RoboRacer Platform / Mattia Piccinini, Patrick Zambiasi, Aniello Mungiello 他
日本語で読む → - 論文自動運転/シミュレーションロボティクス
言語からの制約充足による交通シナリオオーケストレーション
自動運転車のテスト用に、自然言語の記述を制約充足問題として解釈し、シミュレーション内のシナリオを自動生成する手法を提案した論文。
原題: Traffic Scenario Orchestration from Language via Constraint Satisfaction / Frieda Rong, Chris Zhang, Kelvin Wong 他
日本語で読む → - 論文視覚場所認識画像認識
速さか強さか:重み付き集約とトークンプルーニングによる柔軟な視覚場所認識
視覚場所認識の性能と推論速度を両立するため、クラスタへの重み付き集約で識別性を高め、トークンプルーニングで特徴抽出コストを削減する手法を提案した。
原題: Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning / Zichao Zeng, June Moh Goo, Junwei Zheng 他
日本語で読む → - 論文3D物体検出/不確実性/キャリブレーション画像認識
Query2Uncertainty: 分布シフト下での3D物体検出のためのロバストな不確実性定量化とキャリブレーション
DETR型3D物体検出器の潜在クエリの特徴密度を用いて、分布シフト時でも分類と回帰の不確実性を再キャリブレーションする手法を提案した。
原題: Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift / Till Beemelmanns, Alexey Nekrasov, Stefan Vilceanu 他
日本語で読む → - 論文群制御ロボティクス
マルチロボットシステムの分散制御のためのプロトタイピングフレームワーク
分散制御アルゴリズムを単一コンピュータ上で模擬実行できるプロトタイピングフレームワークを提案し、4台のクアッドローターの位置交換タスクで実証した。
原題: A Prototyping Framework for Distributed Control of Multi-Robot Systems / Junaid Ahmed Memon, Allan Andre Do Nascimento, Kostas Margellos 他
日本語で読む → - 論文3次元復元画像認識
TriP: 三角形パズルによる頑健な並進平均化手法
カメラ位置復元のための並進平均化問題に対し、三角形の幾何から局所スケールを推定し、対数領域で同期させることで、外れ値に頑健で高精度な解法を提案した。
原題: TriP: A Triangle Puzzle Approach to Robust Translation Averaging / Zhekai Fan, Wanze Li, Jinxin Wang 他
日本語で読む → - 論文経路計画ロボティクス
磁気ポテンシャル場を用いた自律UAVの安全な3次元経路計画
Maxwell方程式に基づく磁場ポテンシャル場を3次元に拡張し、LiDARボクセルから障害物を考慮したポテンシャル場を予測する畳み込みオートエンコーダを用いて、都市環境でのUAV経路計画を高速化する手法を提案した。
原題: Safe Aerial 3D Path Planning for Autonomous UAVs using Magnetic Potential Fields / Haechan Mark Bong, Giovanni Beltrame
日本語で読む → - 論文ナビゲーションロボティクス
LiftNav: TSDF誘導ガウシアンスプラッティングにおけるセマンティックリフティングによる経路計画
未知の屋内環境でロボットが安全に移動するため、TSDFとガウシアンスプラッティングを融合した地図に、物体検出と3Dリフティングを組み合わせたセマンティックナビゲーション手法を提案した。
原題: LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting / Hannah Schieber, Dominik Frischmann, Victor Schaack 他
日本語で読む → - 論文自動運転/駐車支援ロボティクス
センサ融合と動作計画を用いたトラクタートレーラー輸送車両の駐車支援
トラクタートレーラーの自動駐車を実現するため、センサ融合、Hybrid A*経路計画、非線形モデル予測制御を統合したフレームワークを提案し、オープンソースのA*シミュレーションを拡張して実証した。
原題: Parking Assistance for Trailer-Truck Transport Vehicles Using Sensor Fusion and Motion Planning / George Alenchery, Thomas Jeske, Tova Quinones 他
日本語で読む → - 論文ソフトロボティクスロボティクス
地上用ソフトモバイルロボットの総説
車輪を持たない地上用ソフトロボットの移動戦略、駆動方法、モデリング、制御に関する研究を包括的にレビューし、今後の課題を整理した論文。
原題: Terrestrial Soft Mobile Robots: A Review / Dimuthu D. K. Arachchige
日本語で読む → - 論文計画ロボティクス
信念空間における軌道ツリーの最適化:モデル予測制御からタスク・動作計画への応用
部分観測ロボット計画問題において、逐次軌道ではなく分岐を持つ軌道ツリーを信念空間で最適化する手法を提案し、MPCとTAMPの両方で有効性を示した。
原題: Optimizing Trajectory-Trees in Belief Space: An Application from Model Predictive Control to Task and Motion Planning / Camille Phiquepal, Marc Toussaint
日本語で読む → - 論文深度推定ロボティクス
AnchorD: 因子グラフを用いた単眼深度のメートル単位接地
単眼深度推定の予測を、因子グラフ最適化によりセンサ実測深度に局所的に合わせ込む訓練不要のフレームワークを提案。非ランバート面を含む実環境ベンチマークで精度向上を実証した。
原題: AnchorD: Metric Grounding of Monocular Depth Using Factor Graphs / Simon Dorer, Martin Büchner, Nick Heppert 他
日本語で読む → - 論文模倣学習ロボティクス
非ホロノミック移動台車と双腕の協調制御のための拡散ポリシー:ドア開閉と通過
拡散モデルに基づく視覚運動制御ポリシーを用いて、非ホロノミック移動台車と双腕を協調させ、重いドアの開閉と通過をエンドツーエンドで学習する手法を提案した。
原題: Diffusion Policy for Coordinated Control of a Nonholonomic Mobile Base and Dual Arms in Door Opening and Passing / Shangqun Yu, Matthew En, Daniel Wu 他
日本語で読む → - 論文遠隔操作ロボティクス
視覚ベース遠隔操作のための生成的予測ディスプレイに向けて:既製ビデオモデルのゼロショットベンチマーク
通信遅延による遠隔操作の性能低下を補うため、既製の生成ビデオモデルをゼロショットで用いた短期的な未来フレーム予測のベンチマークを実施し、現状のモデルでは低誤差・非発散・リアルタイム性を同時に満たせないことを示した。
原題: Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models / Aws Khalil, Jaerock Kwon
日本語で読む →