論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
長期的ロボット制御のための視覚運動ポリシーにおける記憶検索
部分観測環境での長期タスクを可能にするため、注意機構を用いた記憶検索を備えた視覚運動ポリシーHALOを提案。VLMの事前知識を活用して誤相関を抑え、記憶誤差の蓄積を軽減する。
原題: Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control / Rutav Shah, Yisu Li, Femi Bello 他
日本語で読む → - 論文ナビゲーションロボティクス
SurveilNav: ロボットと監視システムの協調による物体目標ナビゲーション
監視カメラとロボットを協調させ、大規模環境での物体探索ナビゲーションを効率化するフレームワークを提案した論文。
原題: SurveilNav: Collaborative Object Goal Navigation with Robot and Surveillance System / Ming-Ming Yu, Qunbo Wang, Rongtao Xu 他
日本語で読む → - 論文自動運転ロボティクス
停止が失敗するとき:安全な交通システムのための人間インタラクティブ自動運転による最小リスク条件の再考
自動運転車の安全フレームワークにおける「停止」だけでは不十分であることを、実世界の事故記録の分析から明らかにし、人間との協調的なインタラクション能力を備えた新たな安全パラダイムの必要性を論じた論文。
原題: When Stopping Fails: Rethinking Minimal Risk Conditions through Human-Interactive Autonomous Driving for Safe Transportation Systems / Yash Tandon, Giovanni Tapia Lopez, Marcus Blennemann 他
日本語で読む → - 論文軌道予測ロボティクス
AeroCast: Transformer-MDNアーキテクチャによる非協調航空障害物の確率的3次元軌道予測
非協調な航空障害物(鳥やドローンなど)の将来位置を確率的に予測するため、Transformerエンコーダと混合密度ネットワークを組み合わせたフレームワークAeroCastを提案し、5秒先までの予測誤差を約50%削減した。
原題: AeroCast: Probabilistic 3D Trajectory Prediction for Non-Cooperative Aerial Obstacles via Transformer-MDN Architecture / Syed Izzat Ullah, Jose Baca
日本語で読む → - 論文VLAロボティクス
自己中心視覚理解における二重正解予測を備えた低遅延視覚言語モデルに向けて
人間とロボットの協調作業で重要となる自己中心視覚理解向けVLMの枝刈りを研究し、予測精度と根拠の両方が正しい「二重正解」を保つ新しい枝刈り戦略を提案した。
原題: Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding / Qitong Wang, Fan Du, Pranav Maneriker 他
日本語で読む → - 論文VLA/強化学習ロボティクス
FORCE: 価値校正ウォームアップと自己蒸留による効率的なVLA強化学習ファインチューニング
VLAモデルの強化学習ファインチューニングを安定化・高速化する3段階フレームワークFORCEを提案。価値校正ウォームアップと自己蒸留でサンプル効率を改善し、シミュレーションと実機で成功率を大幅に向上させた。
原題: FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation / Shuyi Zhang, Yunfan Lou, Hongyang Cheng 他
日本語で読む → - 論文触覚ロボティクス
TacVerse: クロスセンサー視覚ベース触覚認識のためのマルチセンサーデータセットとベンチマーク
7種類の視覚ベース触覚センサーから10万枚以上の画像を収集し、形状分類・格子分類・力推定の3タスクでセンサー間の汎化性能を評価するデータセットとベンチマークを構築した。
原題: TacVerse: A Multi-Sensor Dataset and Benchmark for Cross-Sensor Vision-Based Tactile Perception / Lan Wei, Gurmeher Khurana, Sirine Bhouri 他
日本語で読む → - 論文オドメトリロボティクス
FAR-LIO: 高速自律走行を実現する高速・高精度・堅牢なLiDAR-慣性オドメトリ
CUDAで高速化したLiDAR-慣性オドメトリフレームワークFAR-LIOを提案し、自律レースなど高速移動環境での低遅延・高精度な位置推定を実現した。
原題: FAR-LIO: Enabling High-Speed Autonomy through Fast, Accurate, and Robust LiDAR-Inertial Odometry / Maximilian Leitenstern, Marcel Weinmann, Patrick Haft 他
日本語で読む → - 論文触覚探索ロボティクス
TACTFUL: 触覚駆動による閉鎖環境での物体位置特定と識別のための探索
視覚を使わずに触覚のみで多指ロボットが閉鎖空間を自律探索し、物体を発見・識別するフレームワークを提案。実機のみで訓練し、77%の成功率と平均0.015mの再構成誤差を達成。
原題: TACTFUL: Tactile-Driven Exploration For Object Localization and Identification in Confined Environments / Shivani Kamtikar, Chung Hee Kim, Camilla Tabasso 他
日本語で読む → - 論文ナビゲーションロボティクス
オープンな視覚言語モデルを用いた空間QAとナビゲーションのためのバイナリ追跡
ロボットの軌跡の時間順序を利用し、クエリから特定した2つのアンカー地点間で二分探索を行うことで、空間質問応答の精度と速度を向上させるオープンソースのエージェントを提案した。
原題: Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models / Dongbin Na, Chanwoo Kim, Soonbin Rho 他
日本語で読む → - 論文触覚ロボティクス
受動的で柔軟な音響導波路によるスケーラブルな動的触覚センシング
深いサブ波長の音響導波路を用いた受動的分布型触覚センシング手法を提案し、柔軟性を保ちながら高精度な位置検出と波形再構成を実現した。
原題: Scalable Dynamic Tactile Sensing Enabled by Passive and Flexible Acoustic Waveguides / Guimin Long, Changhong Linghu, Chuanping Liu 他
日本語で読む → - 論文外骨格/制御ロボティクス
ExoTraj: 複雑な環境のための汎用下肢外骨格支援ポリシー
動的な外骨格シナリオでの適応トルク予測には高価なモーションキャプチャが必要だが、複雑な屋外環境では実現不可能。本論文では、フローマッチングによる軌道予測とモデル予測制御を統合したExoTrajを提案し、複雑な屋外環境での適応支援を実現する。
原題: ExoTraj: A General Lower-limb Exoskeleton Assistance Policy for Complex Environments / Xiao-Yin Liu, Guotao Li, Long Sun 他
日本語で読む → - 論文ポーズ推定画像認識
G2G: グループ内幾何を活用したグループ間ポーズ推定
2つの画像グループ間の相対6自由度ポーズを推定する手法を提案。グループ内の既知の幾何情報を活用しつつ、基盤モデルは凍結したまま軽量なモジュールを追加して高精度を達成した。
原題: G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation / Yufei Wei, Shuhao Ye, Chenxiao Hu 他
日本語で読む → - 論文強化学習/セキュリティ機械学習
データポイズニングによるステルスな世界モデル操作
モデルベース強化学習エージェントの世界モデルを、微調整データのポイズニングによって操作し、計画を破綻させる攻撃手法SWAAPを提案した。
原題: Stealthy World Model Manipulation via Data Poisoning / Yibin Hu, Xiaolin Sun, Zizhan Zheng
日本語で読む → - 論文制御ロボティクス
安定なTransformer-Actor-Criticモデル予測制御:収縮解析によるアプローチ
TransformerネットワークがδISSを満たすことを証明し、リーマン収縮理論を用いて物理プラントと予測ニューラルネットワークの結合ダイナミクスを解析することで、閉ループ安定性を保証するTransformer-Actor-Critic MPCアーキテクチャを提案した。非線形3Dドローンモデルでの目標到達と障害物回避タスクで検証した。
原題: Stable Transformer-Actor-Critic Model Predictive Control: A Contraction Analysis Approach / Antonio Marino, Valerio Modugno, Marco Cognetti
日本語で読む → - 論文自動運転ロボティクス
エンドツーエンド運転のためのセルフプレイのスケーリング
シミュレーション内で大規模なセルフプレイを用いてエンドツーエンド運転モデルを訓練する手法を提案し、実世界への転移を可能にする。
原題: Scaling Self-Play for End-to-End Driving / Luke Rowe, Roger Girgis, Rodrigue de Schaetzen 他
日本語で読む → - 論文探索アルゴリズムAI
多値ヒューリスティクスと次元削減を橋渡しする多目的探索
多目的最短経路探索において、多値ヒューリスティクスと次元削減を安全に統合する理論的枠組みを提案し、正確性を保証するアルゴリズムを開発した。
原題: Bridging Multi-Valued Heuristics and Dimensionality Reduction in Multi-Objective Search / Maya Wolff, Ariel Felner, Oren Salzman
日本語で読む → - 論文群制御制御
連結・自動運転・人間運転車両のプラトゥーニング:深層強化学習に基づくアプローチ
非連結車両もプラトゥーンに参加可能なハイブリッド編成パターンを提案し、深層強化学習により交通容量と安定性のトレードオフを動的に最適化する制御戦略を開発した。
原題: Platooning Connected, Autonomous, and Human-Driven Vehicles: A Deep Reinforcement Learning-based Approach / Zhen Qina, Dong-Fan Xie, Heng Ma 他
日本語で読む → - 論文群制御制御
適応的安全ゾーンを用いたマルチフリートドローン運用のための分散モデル予測制御
ドローン群の安全ゾーンを速度に応じて適応的に変化させることで、混雑環境での空域利用効率を向上させる分散MPC手法を提案した。
原題: Distributed Model Predictive Control with Adaptive Safety Zones for Multi-Fleet Drone Operations / Linda Mümken, Diyar Altinses, Michael Schwung 他
日本語で読む → - 論文マニピュレーションロボティクス
接触リッチ操作のための超並列サンプリングベースMPCの実機展開
JAXとMuJoCo MJXを用いたサンプリングベースMPCを実機Frankaに展開し、Push-Tタスクでモード切替を要する場合に既存手法より優れることを示した。また、オンラインのドメインランダム化の効果を評価した。
原題: Real-World Deployment of Massively Parallel Sampling-Based MPC for Contact-Rich Manipulation / Magnus Dierking, Joao Carvalho, An Thai Le 他
日本語で読む → - 論文経路計画ロボティクス
多視点ロボット点検のための経路と配置の連成最適化
9自由度ロボットによる点検視点の巡回順序と各視点での逆運動学配置を同時に最適化する統一フレームワークを提案し、モジュール型手法より短時間で衝突のない経路を生成する。
原題: Coupled Routing and Configuration Optimization for Multi-Viewpoint Robotic Inspection / Minh Nhat Vu, Khang Nguyen, Vu Trung Tran 他
日本語で読む → - 論文VLA/不確実性推定ロボティクス
摂動に基づく不確実性による視覚言語行動モデルの故障検出
視覚言語行動モデルに対し、隠れ活性化への摂動注入による不確実性推定を提案し、分布シフト下での故障検出性能を向上させた。
原題: Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models / Yousung Lee, Dongsoo Har
日本語で読む → - 論文群制御ロボティクス
複合ロボットチームの通信と協調のための異種ポリシーネットワーク
異なる状態・行動・観測空間を持つエージェントからなる異種ロボットチームの協調と通信を学習するため、異種グラフアテンションネットワークに基づくHetNetを拡張し、スケーラビリティとバイナリメッセージの効率的な学習を実現した。
原題: Heterogeneous Policy Networks for Composite Robot Team Communication and Coordination / Esmaeil Seraj, Rohan Paleja, Luis Pimentel 他
日本語で読む → - 論文ソフトロボティクスロボティクス
コッセラトロッド理論に基づくソフトロボットの学習ベースモデリング
ソフトロボットの動力学を、コッセラトロッド理論とハミルトン物理を統合したポートハミルトンガウス過程回帰フレームワークで学習・シミュレーションする手法を提案した。
原題: Learning-Based Modeling of Soft Robots via Cosserat Rod Theory / Mohammad Ali, Nithin Senthur Kumar, Eric J. Barth 他
日本語で読む → - 論文ロボット学習ロボティクス
ロボットの自己改善:人間のビデオからの力学モデルを用いて
人間のビデオから学習した行動・力学・価値表現をロボットに転移し、失敗状態を修正するDGAC法を提案。7つの実世界操作タスクで成功率を40%から81%に向上させ、ロボットの自己改善を実証した。
原題: Robot Self-Improvement via Human-Video Dynamics Models / Hanzhi Chen, Anran Zhang, Simon Schaefer 他
日本語で読む → - 論文VLAロボティクス
ASCIIアートがLLMをVLAコントローラに変える
視覚情報をASCII表現に変換してテキストのみのLLMに入力することで、VLAスタイルのコントローラを構築できることを示した論文。シミュレーションと実機の2D操作タスクで有効性を実証している。
原題: ASCII Art Turns LLMs into VLA Controllers / Yitao Jiang, Roy Xing, Luyang Zhao 他
日本語で読む → - 論文操作ロボティクス
細部にこだわるロボット批評家
ロボット操作の成功と失敗を細かく見分ける批評家を、成功・失敗ロールアウトからペアの進捗監視で微調整し、候補行動の選択精度を向上させた。
原題: Robot Critics that Sweat the Small Stuff / Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan 他
日本語で読む → - 論文模倣学習ロボティクス
CoRDE: 概念事前知識によるルーティング拡散エキスパートを用いたロボット操作の構造的一般化
多タスク・長期的なロボット操作学習において、意味的なサブ段階間の勾配衝突を避けるため、概念エンコーダの事前知識でルーティングを制御する拡散エキスパート群(CoRDE)を提案した。パラメータ効率の良いLoRAベースのエキスパートプールにより、ルーティング崩壊を抑えつつ構造的一般化を実現する。
原題: CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation / Haidong Huang, Xixin Zhao, Yaohua Zhou 他
日本語で読む → - 論文データセット/占有予測ロボティクス
ヒューマノイド全方位占有予測:身体化AIのためのステレオベース全周囲占有データセット
ヒューマノイドロボット向けに、ステレオカメラを用いた大規模な全周囲占有データセットを構築し、Real2Sim2Realパイプラインで実環境への汎化を実証した。
原題: Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI / Xianda Guo, Bohao Zhang, Chenwei Huang 他
日本語で読む → - 論文ロボットマニピュレーションロボティクス
HiL-ResRL: 人間参加型残差強化学習によるモデル非依存のファインチューニングアダプタ
模倣学習のVLAモデルに対して、モデル非依存でプラグイン可能な残差ポリシーを強化学習で訓練し、実ロボットで1.5時間の学習で成功率95%以上を達成するファインチューニング手法を提案した。
原題: HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning / Jingyi Liu, Zhaohong Mai, ShunSen He 他
日本語で読む →