論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLM/空間推論自然言語
多ターン・マルチエージェント対話による協調的再構築はVLMの空間推論性能をわずかに向上させる
視覚言語モデル(VLM)が協調的な構造構築タスクで空間推論を行う能力を評価し、対話による再構築フレームワークを提案。詳細なテキスト表現や分解された画像表現が性能を向上させることを示した。
原題: Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely / Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen
日本語で読む → - 論文自動運転/交通流モデル制御
SEIDM: 自動運転行動のための安全かつ効率的な知的運転者モデル
IDMの保守性による交通効率低下を改善するため、安全係数を動的に調整するSEIDMを提案し、シミュレーションで安定性と効率の向上を実証した。
原題: SEIDM: A Safe and Efficient Intelligent Driver Model for Autonomous Driving Behavior / Yuyang Yao, Shaocheng Luo
日本語で読む → - 論文データセット画像認識
FRED: 冠水道路環境向けマルチモーダル自動運転データセット
冠水した道路環境に特化した初のマルチモーダル自動運転データセットを構築し、カメラ・LiDAR・IMU/GNSSデータとセマンティックラベルを提供する。
原題: FRED: A Multi-Modal Autonomous Driving Dataset for Flooded Road Environments / Connor Malone, Sebastien Demmel, Sebastien Glaser
日本語で読む → - 論文ナビゲーションロボティクス
VLM-LLMナビゲーションにおけるボトルネックの探求:3Dシーン理解能力がゼロショットVLNに与える影響
ゼロショット視覚言語ナビゲーション(VLN)における3Dシーン理解の精度がナビゲーション性能に与える影響を定量化し、知覚精度の向上が一定以上で効果が頭打ちになる「知覚飽和現象」を明らかにした。
原題: Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN / Ziyi Xia, Chaoran Xiong, Litao Wei 他
日本語で読む → - 論文手術ロボット/力覚センシングロボティクス
シャフト一体型力覚センシングとTransformerによる動的補償を備えた遠隔手術システム
ケーブル駆動の手術器具に6軸力センサを組み込み、Transformerで内部ケーブル力を補償して先端力を推定する手法を提案した。
原題: Shaft-integrated Force Sensing with Transformer-based Dynamics Compensation for Telesurgery / Shuyuan Yang, Grant Boone, Timo Markert 他
日本語で読む → - 論文HRIロボティクス
ロボット・ラングラー(世話役)のための設計: 文献と実践の統合
病院や倉庫など人間の空間で働くロボットを設置・監視・トラブルシュートする「ロボット・ラングラー」という新たな役割に着目し、文献レビューと自身の経験からその活動の複雑さを整理し、支援のための設計示唆を導き出した論文。
原題: Designing for Robot Wranglers: A Synthesis of Literature and Practice / David Porfirio, Ian McDermott, Hsin-Mei Chen 他
日本語で読む → - 論文遠隔操作HCI
VMAFを超えて:遠隔操作ビデオ向けアプリケーション特化型メトリクスに向けて
自動運転の遠隔操作におけるビデオ品質評価を改善するため、Zenseactデータセットの圧縮動画に対する主観評価を用いてVMAFモデルを再学習し、遠隔操作に特化した品質メトリクスを開発した。
原題: Beyond VMAF: Towards Application-Specific Metrics for Teleoperation Video / Ines Trautmannsheimer, Richard Grauberger, Frank Diermeyer
日本語で読む → - 論文制御ロボティクス
資源制約ハードウェア上での羽ばたきロボットのニューロモルフィック制御
ESP32マイコン上でスパイキングニューラルネットワークを用いた階層的制御により、羽ばたき飛行ロボットの完全オンボード閉ループ飛行を実現した。
原題: Neuromorphic Control of a Flapping-Wing Robot on Resource-Constrained Hardware / Rim El Filali, Chenrui Feng, Chao Gao 他
日本語で読む → - 論文ビジュアルオドメトリロボティクス
スパース点群出力を備えた深層イベントビジュアルオドメトリの拡張
イベントカメラ用の深層ビジュアルオドメトリ(DEVO)に、内部で推定した3次元構造をスパース点群として出力するパイプラインを追加し、可視化や後処理を可能にした。実験では、出力された点群が局所的に高精度である一方、密度や完全性に限界があることを示した。
原題: Extending Deep Event Visual Odometry with Sparse Point-Cloud Export / Alireza Safdari, Sajad Ashraf
日本語で読む → - 論文ハンドトラッキング画像認識
適応的視覚-IMU融合による3Dハンドトラッキング
視線画像と手袋に装着したIMU信号を適応的に融合し、特に手と物体の相互作用時の遮蔽下でも高精度な3D手の姿勢追跡を実現する手法を提案した。
原題: AVI-HT: Adaptive Vision-IMU Fusion for 3D Hand Tracking / Ziyi Kou, Ankit Kumar, Mia Huang 他
日本語で読む → - 論文データセット/軌道予測画像認識
EgoTraj: 実世界の自己中心視点による人間軌道予測のためのマルチモーダルデータセット
自己中心視点での人間の軌道予測を目的とした、実世界の都市環境で収集したマルチモーダルデータセットEgoTrajを提案し、視線・シーン・動きの手がかりの寄与を分析した。
原題: EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction / Ahmad Yehia, Abduallah Mohamed, Tianyi Wang 他
日本語で読む → - 論文VLA解釈可能性ロボティクス
イベント基盤のスパースオートエンコーダによる視覚言語行動ポリシーの解釈
視覚言語行動(VLA)ポリシーの隠れ表現を、行動イベントに基づいてスパースオートエンコーダ(SAE)で分析し、閉ループ行動への因果効果を評価する解釈可能性パイプラインを提案した。
原題: Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies / Xinchen Jin, Aditya Chatterjee, Pranav Kumar 他
日本語で読む → - 論文模倣学習ロボティクス
X-Imitator: 双方向アクション・ポーズ相互作用による空間認識模倣学習
空間認識と行動生成を双方向ループで結びつけ、相互に洗練させる新しい模倣学習フレームワークを提案。24のシミュレーションと3つの実世界タスクで性能を実証した。
原題: X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction / Kai Xiong, Hongjie Fang, Lixin Yang 他
日本語で読む → - 論文強化学習機械学習
FLAG: 潜在拡張ガイダンスによるフローポリシーMaxEnt-RL
最大エントロピー強化学習において、重要度重みの崩壊を避けるためサンプリング領域を局所化し、フロー潜在変数で状態空間を拡張して代理目的を最適化する手法FLAGを提案。高次元制御タスクでSOTA性能を達成。
原題: FLAG: Flow Policy MaxEnt-RL by Latent Augmented Guidance / Sungha Kim, Gawon Lee, Jusuk Lee 他
日本語で読む → - 論文操作学習ロボティクス
Tabero: 視覚・触覚・言語からの閉ループ力フィードバックによる優しい操作の学習
触覚フィードバックを活用した優しいロボット操作を実現するため、データ効率的なパイプラインで視覚・触覚・言語データを生成し、力と位置を分離した指令インターフェースを持つモデルを提案。優しい指示下で把持力を70%以上削減しつつ高い成功率を維持した。
原題: Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language / Qiwei Wu, Rui Zhang, Xin Xiang 他
日本語で読む → - 論文マニピュレーションロボティクス
TapSampling: タスク進捗理解型検証器を用いた推論時サンプリングによるロボット操作
ロボット操作の汎用ポリシーに対して、推論時に複数の行動候補をサンプリングし、タスク進捗を予測する検証器で最適な行動を選ぶプラグアンドプレイなフレームワークを提案した。
原題: TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation / Sizhe Zhao, Shengping Zhang, Shuo Yang 他
日本語で読む → - 論文ナビゲーションロボティクス
MASt3R-Nav: 相対3DマップにおけるWayPixelナビゲーション
画像ペア間の相対3D座標系でのピクセル対応に基づくピクセル相対接続性マップを提案し、これをコストマップとして用いて制御器を訓練することで、高精度な視覚ナビゲーションを実現した。
原題: MASt3R-Nav: WayPixel Navigation in Relative 3D Maps / Vansh Garg, Rohit Jayanti, Krish Pandya 他
日本語で読む → - 論文VLAロボティクス
X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデル
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
原題: X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models / Boyu Li, Chaoyi Xu, Haoqi Yuan 他
日本語で読む → - 論文制御ロボティクス
多様体制約付きMPPI:ハード制約下でのリアルタイムサンプリングベース制御
標準MPPIのソフトペナルティでは保証できないハード制約を満たすため、VAEで制約多様体の潜在表現を学習し、実行レベルでQPにより残差を補正するMC-MPPIを提案した。閉連鎖双腕システムで100Hz動作を実証した。
原題: Manifold-Constrained MPPI: Real-Time Sampling-Based Control Under Hard Constraints / Seulchan Lee, Sanghyun Kim
日本語で読む → - 論文状態推定制御
デュアルIMU計測と相対位置センシングを用いた相対姿勢・速度推定
移動対象と車両の両方にIMUを搭載し、相対位置または方位計測を用いて、対象に対する車両の相対姿勢・速度を推定する手法を提案した。SE_2(3)上の線形時変モデルに基づく決定論的Riccatiオブザーバと、SO(3)上の相補フィルタを設計し、収束条件を解析した。
原題: Relative Pose-Velocity Estimation Using Dual IMU Measurements and Relative Position Sensing / Alessandro Melis, Tarek Bouazza, Soulaimane Berkane 他
日本語で読む → - 論文群制御ロボティクス
トポロジー駆動型ソフトロボットの絡まり防止制御
複数のソフトロボットが絡まらないように、トポロジー情報を活用したマルチエージェント強化学習フレームワークを提案した論文。
原題: Topology-Driven Anti-Entanglement Control for Soft Robots / Haoyang Le, Shengxuan Wang, Mohan Chen 他
日本語で読む → - 論文マッピングロボティクス
変化に頑健なオンライン空間意味トポロジカルマッピング
環境変化に頑健な空間意味推論のため、RGB-Dキーフレームのオンライン・ポーズ認識トポロジカルグラフを提案し、連続SE(3)での逐次仮説検定により曖昧さを扱う。実ロボット実験でSLAMベース手法より頑健性が向上。
原題: Change-Robust Online Spatial-Semantic Topological Mapping / Jiaming Wang, Jizhuo Chen, Diwen Liu 他
日本語で読む → - 論文空中操作/制御ロボティクス
クワッドローターによるケーブル吊り下げ荷物の敏捷な輸送のためのセンサレス状態推定と制御
UAVによるケーブル吊り下げ荷物の輸送において、Udwadia-Kalaba法を用いてケーブルの幾何学的制約を明示的にモデル化し、センサレスで荷物の状態を推定しつつNMPCに統合する手法を提案した。実機実験で軌道追従誤差が低減することを示した。
原題: Sensorless State Estimation and Control for Agile Cable-Suspended Payload Transport by Quadrotors / Ana Maria Nascimento, Augusto Sales, Antonio Marcus Lima 他
日本語で読む → - 論文ナビゲーションロボティクス
EvoNav: 大規模言語モデルを用いたロボットナビゲーションの進化的報酬関数設計
ロボットナビゲーションの強化学習における報酬関数の設計を、大規模言語モデルと進化的アルゴリズムで自動化する手法を提案した論文。
原題: EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models / Zhikai Zhao, Chuanbo Hua, Federico Berto 他
日本語で読む → - 論文シミュレーションロボティクス
関節物体のシミュレーション物理を自動改善する手法
不完全な3Dアセットから、シミュレーションで安定して操作可能な関節物体を自動生成する手法を提案。物理特性を推論し、シミュレータからのフィードバックで反復的に改善する。
原題: Automatically Improving Simulation Physics for Articulated Objects / Anh-Quan Pham
日本語で読む → - 論文自動運転/駐車支援ロボティクス
センサ融合と動作計画を用いたトラクタートレーラー輸送車両の駐車支援
トラクタートレーラーの自動駐車を実現するため、センサ融合、Hybrid A*経路計画、非線形モデル予測制御を統合したフレームワークを提案し、オープンソースのA*シミュレーションを拡張して実証した。
原題: Parking Assistance for Trailer-Truck Transport Vehicles Using Sensor Fusion and Motion Planning / George Alenchery, Thomas Jeske, Tova Quinones 他
日本語で読む → - 論文ナビゲーションロボティクス
言語から論理へ:VLMに基づく安全ナビゲーションのための理論的アーキテクチャ
自然言語の安全規則をSignal Temporal Logic (STL)仕様に変換し、Vision-Language Models (VLMs)を用いて屋外環境での自律ナビゲーションを安全に導く理論的アーキテクチャを提案した。
原題: From Language to Logic: A Theoretical Architecture for VLM-Grounded Safe Navigation / Kristy Sakano, Kalonji Harrington, Mumu Xu
日本語で読む → - 論文遠隔操作ロボティクス
視覚ベース遠隔操作のための生成的予測ディスプレイに向けて:既製ビデオモデルのゼロショットベンチマーク
通信遅延による遠隔操作の性能低下を補うため、既製の生成ビデオモデルをゼロショットで用いた短期的な未来フレーム予測のベンチマークを実施し、現状のモデルでは低誤差・非発散・リアルタイム性を同時に満たせないことを示した。
原題: Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models / Aws Khalil, Jaerock Kwon
日本語で読む → - 論文模倣学習ロボティクス
FocalPolicy: 周波数最適化チャンキングと局所アンカー付きフローマッチングによる一貫性のある視覚運動ポリシー
視覚運動ポリシーにおけるチャンク間の不連続性を解決するため、周波数最適化チャンキングと局所アンカー付きフローマッチングを組み合わせたFocalPolicyを提案した。
原題: FocalPolicy: Frequency-Optimized Chunking and Locally Anchored Flow Matching for Coherent Visuomotor Policy / Qian He, Zhenshuo Yang, Wenqi Liang 他
日本語で読む → - 論文深度推定ロボティクス
AnchorD: 因子グラフを用いた単眼深度のメートル単位接地
単眼深度推定の予測を、因子グラフ最適化によりセンサ実測深度に局所的に合わせ込む訓練不要のフレームワークを提案。非ランバート面を含む実環境ベンチマークで精度向上を実証した。
原題: AnchorD: Metric Grounding of Monocular Depth Using Factor Graphs / Simon Dorer, Martin Büchner, Nick Heppert 他
日本語で読む →