論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文データセット画像認識
CM-EVS: 完全なシーンカバレッジのためのスパースなパノラマRGB-D-ポーズデータ
3Dアセットを、冗長性が低く完全なシーンカバレッジを持つスパースなパノラマRGB-D-ポーズデータに変換する手法COVERを提案し、大規模データセットCM-EVSを構築した。
原題: CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage / Jiale Liu, Jungang Li, Jieming Yu 他
日本語で読む → - 論文ベンチマークロボティクス
WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
原題: WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform / Yu Shang, Yinzhou Tang, Yiding Ma 他
日本語で読む → - 論文通信ネットワークロボティクス
身体化エージェントを可能にする6G通信ネットワーク:アーキテクチャとプロトタイプ
身体化エージェントの通信要件を分析し、6G技術を活用した階層型通信アーキテクチャを提案、実証プロトタイプを実装した論文。
原題: 6G Communication Networks Enabling Embodied Agents: Architecture and Prototype / Lipeng Dai, Luping Xiang, Kun Yang
日本語で読む → - 論文VLAロボティクス
原始サブスペースがVLAの少数ショット転移を仲介する
VLAポリシーを原始動作単位で訓練すると、少数のデモンストレーションで未学習タスクを実行できる転移可能なサブスキルライブラリが獲得され、フラットな軌道訓練と比べて3倍のサンプル効率向上が達成されることを示した。
原題: Primitive Subspaces Mediate Few-Shot Transfer in VLAs / Anya Singh, Cabrel Happi, Jai Relan 他
日本語で読む → - 論文プライバシー/身体化AIAI
位置づけ:身体化AIにはプライバシーと実用性のトレードオフが必要
身体化AI(EAI)システムが実環境で頻繁に使用される際、各段階を独立に最適化するとプライバシー漏洩が不可逆的になるという問題を指摘し、ライフサイクル全体でプライバシーを動的制御信号として扱う統合フレームワークSPINEを提案した。
原題: Position: Embodied AI Requires a Privacy-Utility Trade-off / Xiaoliang Fan, Jiarui Chen, Zhuodong Liu 他
日本語で読む → - 論文最適化/GPUロボティクス
Caspar: 適応的並べ替えを備えたシンボリックプログラミング用CUDAアクセラレータ
Casparは、Pythonのシンボリック式から最適化されたCUDAカーネルを自動生成し、GPU上で非線形最適化を高速に実行するライブラリです。バンドル調整で既存手法より5〜20倍高速で、メモリ使用量も少ないことを示しています。
原題: Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering / Emil Martens, Aaron Miller, Matias Varnum 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワーク
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
原題: Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs / Jiahui Niu, Kefan Gu, Yucheng Zhao 他
日本語で読む → - 論文ビデオ生成/身体性転移ロボティクス
身体性ギャップを橋渡しする:分離型クロス身体性ビデオ編集
人間のデモ動画からロボットの実行動画を生成する際、タスク情報と身体性情報を分離して表現し、拡散モデルを用いてロボット動画を合成する手法を提案した。
原題: Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing / Zhiyuan Li, Wenyan Yang, Wenshuai Zhao 他
日本語で読む → - 論文マニピュレーションロボティクス
効率的なKoopman作用素ベースモデル予測制御による動的ロボット布折りたたみ
布の動的折りたたみを高速かつ正確に行うため、物理シミュレーションとKoopman作用素回帰を用いた線形モデルをモデル予測制御に組み込み、折りたたみ軌道を効率的に生成する手法を提案した。
原題: Dynamic robotic cloth folding with efficient Koopman operator-based model predictive control / Edoardo Caldarelli, Franco Coltraro, Adrià Colomé 他
日本語で読む → - 論文表現学習ロボティクス
SCAR: 自己教師あり連続行動表現学習
視覚遷移から複数の身体に共通する行動表現を学習する枠組みを提案し、世界モデルの汎化性能を向上させた。
原題: SCAR: Self-Supervised Continuous Action Representation Learning / Hongjia Liu, Fan Feng, Minghao Fu 他
日本語で読む → - 論文自動運転画像認識
NTR: エンドツーエンド運転におけるシーントークンボトルネックのためのニューラルトークン再構成
エンドツーエンド自動運転のシーントークンボトルネックに、マスク潜在再構成による自己蒸留を導入し、計画に有用な視覚表現を保持させる手法を提案。
原題: NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving / Jiahui Li, Jiawei Sun, Zixiang Ren 他
日本語で読む → - 論文動作生成/制御ロボティクス
動作実行ギャップの解消:意味的動作タスク制約から運動学制御へ
高レベルの意味的タスク記述と実行可能なロボット動作の間のギャップを埋めるため、Motion Statechartsと微分可能な運動学世界モデルを用いたフレームワークGiskardを提案し、8つのロボットプラットフォームで実証した。
原題: Closing the Motion Execution Gap: From Semantic Motion Task Constraints to Kinematic Control / Simon Stelter, Vanessa Hassouna, Malte Huerkamp 他
日本語で読む → - 論文VLA/パラメータ効率的ファインチューニングロボティクス
VLA-GSE: 一般・専門エキスパートによるVLAのパラメータ効率的ファインチューニングの強化
VLAモデルのロボット制御への適応を改善するため、凍結バックボーンのスペクトル分解に基づき、一般エキスパートと専門エキスパートを導入したパラメータ効率的ファインチューニング手法を提案した。
原題: VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts / Yuhua Jiang, Junjie Lu, Xinyao Qin 他
日本語で読む → - 論文探索ロボティクス
重要情報の学習:適応的情報理論に基づくロボット探索の目的関数
ロボット探索における情報理論的目的関数の設計課題に対し、フィッシャー情報行列の固有空間解析で観測可能なパラメータ方向を特定し、重要方向を強調する適応的目的関数Q-OEDを提案した。シミュレーションと実機のナビゲーション・操作タスクで有効性を検証した。
原題: Learning What Matters: Adaptive Information-Theoretic Objectives for Robot Exploration / Youwei Yu, Jionghao Wang, Zhengming Yu 他
日本語で読む → - 論文群制御ロボティクス
マルチロボット持続監視における最悪ケース重み付き遅延の最小化:理論と強化学習に基づく解法
重み付きグラフ上でのマルチロボット持続監視問題を扱い、無限時間地平線での最悪ケース重み付き遅延を最小化する軌道設計を提案。尾部性能指標を導入し、強化学習を用いた解法とベンチマークを提供する。
原題: Minimizing Worst-Case Weighted Latency for Multi-Robot Persistent Monitoring: Theory and RL-Based Solutions / Weizhen Wang, Ziheng Wang, Jianping He 他
日本語で読む → - 論文UAV/点検計画ロボティクス
ASIP-Planner: 部分既知の屋内環境におけるUAV表面点検のための適応的計画
事前のフロアプランに基づく点検計画が、未知の障害物による遮蔽で劣化する問題に対し、セグメントベースの大域計画と局所視点適応を組み合わせたUAV点検フレームワークを提案した。
原題: ASIP-Planner: Adaptive Planning for UAV Surface Inspection in Partially Known Indoor Environments / Hanyu Jin, Zhefan Xu, Haoyu Shen 他
日本語で読む → - 論文手姿勢推定/イベントカメラ画像認識
EgoEV-HandPose: ステレオイベントカメラによる自己中心視点の3D手姿勢推定とジェスチャ認識
ステレオイベントカメラを用いて、自己中心視点での両手の3D姿勢推定とジェスチャ認識を同時に行うエンドツーエンドフレームワークを提案し、大規模な実世界データセットも構築した。
原題: EgoEV-HandPose: Egocentric 3D Hand Pose Estimation and Gesture Recognition with Stereo Event Cameras / Luming Wang, Hao Shi, Jiajun Zhai 他
日本語で読む → - 論文タスク計画ロボティクス
AssemPlanner: 柔軟な組立システムのためのマルチエージェント型タスク計画フレームワーク
自然言語で記述された組立タスクを、複数の専門エージェントとシーングラフを用いて実行可能な生産手順に変換するマルチエージェント型タスク計画フレームワークを提案した。
原題: AssemPlanner: A Multi-Agent Based Task Planning Framework for Flexible Assembly System / Chenhao Zhang, Chaoran Zhang, Zhaobo Xu 他
日本語で読む → - 論文ベンチマーク画像認識
OSMa-Bench++: プロンプト生成による合成シーンを用いた操作のための意味マッピングのオープンエンドベンチマーク
操作タスク向け意味マッピング手法の評価を、プロンプトから生成した合成屋内シーンで自動的に行えるように拡張したベンチマークを提案。
原題: OSMa-Bench++: Toward Open-Ended Benchmarking of Semantic Mapping for Manipulation with Prompt-Generated Synthetic Scenes / Regina Kurkova, Maxim Popov, Sergey Kolyubin
日本語で読む → - 論文システム同定機械学習
リザーバーリフティングによる非線形システムのクープマン同定
リザーバーコンピューティングの考え方を応用し、非線形力学系を線形表現するクープマン演算子の辞書としてリザーバーを用いる手法を提案した論文。
原題: Koopman Identification of Nonlinear Systems via Reservoir Liftings / Weibin Gu, Chen Yang, Lu Shi
日本語で読む → - 論文移動操作/模倣学習ロボティクス
Mobile UMI: 移動操作のための分離された運動学を備えたクロスビュー拡散ポリシー
移動模倣学習における移動と操作の結合問題を解決するため、デュアルカメラと空間アンカーで操作とベース軌道を分離し、非同期実行で遅延を補正するフレームワークを提案した。
原題: Mobile UMI: Cross-View Diffusion Policy with Decoupled Kinematics for Mobile Manipulation / Haoran Huang, Haonan Dong, Huixu Dong
日本語で読む → - 論文群制御ロボティクス
接続グラフ上のAoIを考慮したマルチロボットセンシングと輸送
複数のロボットが分散プロセスを監視し、基地局へ測定値を届ける際の情報鮮度(AoI)を最適化する問題を扱い、下限の導出と最適な資源配分・輸送経路設計を提案した論文。
原題: AoI-Aware Multi-Robot Sensing and Transport on Connected Graphs / John Tadrous
日本語で読む → - 論文ナビゲーションロボティクス
動的環境におけるロボットナビゲーションのための意味論的リスク認識ヒューリスティック計画法:LLMに着想を得たアプローチ
LLMの推論原理を古典的な経路計画に取り入れ、混雑・高リスク領域を罰するコスト関数をA*探索に組み込んだ意味論的リスク認識ヒューリスティック計画法を提案し、動的障害物検知時の再計画で性能を評価した。
原題: Semantic Risk-Aware Heuristic Planning for Robotic Navigation in Dynamic Environments: An LLM-Inspired Approach / Hamza Ahmed Durrani, Rafay Suleman Durrani
日本語で読む → - 論文自動運転/強化学習/sim2realロボティクス
効率的かつ転移可能な制御学習のためのダイナミクス蒸留
高忠実度シミュレータのダイナミクスを並列化可能な学習モデルに蒸留し、その中で強化学習を行って元のシミュレータへ展開するSim2Sim2Simフレームワークを提案した。
原題: Dynamics Distillation for Efficient and Transferable Control Learning / Xunjiang Gu, Kashyap Chitta, Mahsa Golchoubian 他
日本語で読む → - 論文空中操作/制御ロボティクス
クワッドローターによるケーブル吊り下げ荷物の敏捷な輸送のためのセンサレス状態推定と制御
UAVによるケーブル吊り下げ荷物の輸送において、Udwadia-Kalaba法を用いてケーブルの幾何学的制約を明示的にモデル化し、センサレスで荷物の状態を推定しつつNMPCに統合する手法を提案した。実機実験で軌道追従誤差が低減することを示した。
原題: Sensorless State Estimation and Control for Agile Cable-Suspended Payload Transport by Quadrotors / Ana Maria Nascimento, Augusto Sales, Antonio Marcus Lima 他
日本語で読む → - 論文自動運転/駐車支援ロボティクス
センサ融合と動作計画を用いたトラクタートレーラー輸送車両の駐車支援
トラクタートレーラーの自動駐車を実現するため、センサ融合、Hybrid A*経路計画、非線形モデル予測制御を統合したフレームワークを提案し、オープンソースのA*シミュレーションを拡張して実証した。
原題: Parking Assistance for Trailer-Truck Transport Vehicles Using Sensor Fusion and Motion Planning / George Alenchery, Thomas Jeske, Tova Quinones 他
日本語で読む → - 論文VLAロボティクス
3DVLA: 3次元空間・インスタンス理解による視覚言語行動モデルの強化
視覚言語行動モデルに3次元空間理解とインスタンス理解を注入するプラグアンドプレイフレームワークを提案し、操作性能を向上させた。
原題: 3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding / Zhongyu Xia, Yousen Tang, Bingqing Wei 他
日本語で読む → - 論文イベントベース視覚/FPGA/速度推定ロボティクス
EventShiftFlow:FPGAベースのハードウェア効率的なフロー推定に向けて
イベントベースの視覚センサーを用いて、固定幅整数演算のみで並列に速度仮説を評価するストリーミング速度推定器を提案し、FPGA実装に適したハードウェア効率的な手法を示した。
原題: EventShiftFlow: Towards Hardware-efficient FPGA-based Flow Estimation / Arianna Alonso Bizzi, Fernando Cladera, C. J. Taylor
日本語で読む → - 論文オフライン強化学習機械学習
オフライン強化学習のための軌道レベルデータ拡張
限られた準最適な軌道からオフライン強化学習を効果的に行うため、タスク構造と報酬・価値関数・ロギングポリシーの幾何学的関係を利用した軌道ベースのデータ拡張手法を提案し、理論的正当性と実験的検証を行った。
原題: Trajectory-Level Data Augmentation for Offline Reinforcement Learning / Tobias Schmähling, Matthias Burkhardt, Tobias Windisch
日本語で読む → - 論文深度推定ロボティクス
AnchorD: 因子グラフを用いた単眼深度のメートル単位接地
単眼深度推定の予測を、因子グラフ最適化によりセンサ実測深度に局所的に合わせ込む訓練不要のフレームワークを提案。非ランバート面を含む実環境ベンチマークで精度向上を実証した。
原題: AnchorD: Metric Grounding of Monocular Depth Using Factor Graphs / Simon Dorer, Martin Büchner, Nick Heppert 他
日本語で読む →