論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ナビゲーションロボティクス
HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
原題: HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation / Haoxuan Xu, Tianfu Li, Wenbo Chen 他
日本語で読む → - 論文自動運転画像認識
CLAP: 対比学習による潜在空間プロンプト最適化を用いたエンドツーエンド自動運転
凍結したVLAモデルに、道路ブロックごとのソフトプロンプトをクラウドソーシングデータから最適化し、V2X通信で取得することで、長尾の困難なシナリオでの性能を向上させる適応フレームワークを提案。
原題: CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving / Ruiyang Zhu, Yuehan He, Boyuan Zheng 他
日本語で読む → - 論文データセットロボティクス
4DLidarOpen: 動作認識のためのオープンな4D FMCWライダーデータセット
自動運転向けに、4D FMCWライダーによる速度情報を含む大規模なマルチモーダルデータセットを構築し、3D物体検出やBEVセグメンテーション、フロー予測などのベンチマークを提供した。
原題: 4DLidarOpen: An Open 4D FMCW Lidar Dataset for Motion-Aware Autonomous Driving / Kane Qian, Xin Zhao, Yining Shi 他
日本語で読む → - 論文モデル予測制御機械学習
ユークリッド近接を超えて:地平線一致軌道到達可能性メトリクスによる潜在世界モデルの修復
潜在世界モデルにおける終端コストの誤ったランキングを修正するため、軌道到達可能性メトリクス(TRM)を提案し、固定された潜在モデルに対して後付けで学習する手法を実証した。
原題: Beyond Euclidean Proximity: Repairing Latent World Models with Horizon-Matched Trajectory Reachability Metrics / Liangyu Li, Shengzhi Wang, Qingwen Liu
日本語で読む → - 論文VLA画像認識
StableVLA: 追加データなしで堅牢な視覚言語行動モデルを実現
視覚障害に対するVLAモデルの脆弱性を調査し、情報理論に基づく軽量アダプタ(IB-Adapter)を提案。追加データや拡張なしで平均30%の性能向上を達成し、パラメータ増加は10M未満。
原題: StableVLA: Towards Robust Vision-Language-Action Models without Extra Data / Yiyang Fu, Chubin Zhang, Shukai Gong 他
日本語で読む → - 論文動作計画ロボティクス
動的ガイダンスを備えたコスト拡散モデルによる動作計画
拡散モデルのノイズ除去過程を衝突コストの勾配で動的にガイドし、多様な環境で衝突回避軌道を生成する手法を提案した。
原題: Sum of Costs Diffusion with Dynamic Guidance for Motion Planning / Aysu Aylin Kaplan, Özgür Erkent
日本語で読む → - 論文VLAロボティクス
ビデオモデルを汎用ロボットポリシーへ変換する
ビデオ生成モデルをそのまま使い、逆動力学モデル(IDM)を個別に学習してビデオ計画を行動に変換する手法を提案。シミュレーションと実世界で高い性能を示した。
原題: Turning Video Models into Generalist Robot Policies / Sizhe Lester Li, Evan Kim, Xingjian Bai 他
日本語で読む → - 論文VLA/表現学習ロボティクス
DynaFLIP:三モーダル動力学誘導表現によるロボット知覚の再考
画像と言語と3Dフローを組み合わせた動力学認識の事前学習フレームワークを提案し、ロボット操作のための視覚表現を向上させた。
原題: DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation / Jusuk Lee, Seungjae Lee, Jonghun Shin 他
日本語で読む → - 論文計画/模倣学習AI
シンボリック世界モデル上の二段階ポリシー学習による長期的計画
低レベルの模倣学習と高レベルのシンボリック抽象化を組み合わせた二段階ポリシーを提案し、長期的な計画問題を効率的に解決するシステムBISONを実装した。
原題: Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning / Dillon Z. Chen, Till Hofmann, Toryn Q. Klassen 他
日本語で読む → - 論文点群レジストレーションロボティクス
Paired-CSLiDAR: 高さ層別レジストレーションによる空中・地上LiDARのクロスソース位置姿勢精緻化
空中と地上のLiDARスキャン間の位置姿勢を高精度に補正するため、共有される地面に着目した高さ層別ICPと逆方向レジストレーションを組み合わせた学習不要のパイプラインRGSRを提案し、ベンチマークで高い成功率を達成した。
原題: Paired-CSLiDAR: Height-Stratified Registration for Cross-Source Aerial-Ground LiDAR Pose Refinement / Montana Hoover, Jing Liang, Tianrui Guan 他
日本語で読む → - 論文探査/制御ロボティクス
FU-MPC:モーター駆動LiDARを用いた効率的かつ高精度なUAV探査のためのフロンティア・不確実性考慮モデル予測制御
未知環境でのUAV探査効率と自己位置推定精度を両立するため、独立駆動の回転LiDARを搭載し、飛行軌道に沿ってLiDARの回転を最適化する階層的探査フレームワークを提案した。
原題: FU-MPC: Frontier- and Uncertainty-Aware Model Predictive Control for Efficient and Accurate UAV Exploration with Motorized LiDAR / Jianping Li, Pengfei Wan, Zhongyuan Liu 他
日本語で読む → - 論文安全制御ロボティクス
ポリシーライブラリCBF:並列ロールアウトによる実行時の有限時間安全性保証
複数のフォールバックポリシーを並列に評価し、最も侵襲の少ない安全な動作を選択する実行時安全フィルタを提案。理論解析とシミュレーションで有効性を示した。
原題: Policy Library CBF: Finite-Horizon Safety at Runtime via Parallel Rollouts / Taekyung Kim, Hideki Okamoto, Bardh Hoxha 他
日本語で読む → - 論文自動運転ロボティクス
自己対戦とスケールを超えて:自動運転の汎化のための行動ベンチマーク
大規模強化学習で訓練された自動運転ポリシーを標準ベンチマークで評価するための包括的なテストスイート「BehaviorBench」を提案する。
原題: Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving / Aron Distelzweig, Faris Janjoš, Andreas Look 他
日本語で読む → - 論文歩行ロボティクス
ロボット・イカゲーム:狭いトンネルを横断する四足歩行
四足ロボットが狭いトンネルなどの閉鎖環境を自律的に移動するための強化学習フレームワークを提案。手続き的環境生成とポリシー蒸留を組み合わせ、複雑な報酬設計なしで多様なトンネル形状に対応する。
原題: Robot Squid Game: Quadrupedal Locomotion for Traversing Narrow Tunnels / Amir Hossain Raj, Dibyendu Das, Xuesu Xiao
日本語で読む → - 論文VLA/解釈可能性ロボティクス
具現化解釈可能性:視覚-言語-行動モデルにおける因果理解と汎化の関連付け
視覚-言語-行動モデルの分布シフト時の失敗原因を、介入的帰属スコア(ISS)とノイズ質量比(NMR)を用いて分析し、因果的誤整列の診断手法を提案した論文。
原題: Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models / Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer 他
日本語で読む → - 論文触覚インタラクションロボティクス
ポケットサイズロボティクスによる落ち着きの誘発:手持ち触覚インタラクションによる子どもの動きと心拍数の低減
手持ち型の触覚デバイスを使ったリズム合わせゲームが、子どもの心拍数と全身の動きを有意に減少させ、落ち着きを促すことを示した研究。
原題: Inducing Calmness With Pocket-Sized Robotics: Reducing Movement and Heart Rate in Children through Hand-Held Tactile Interactions / Morten Roed Frederiksen, Kasper Støy, Maja Matarić
日本語で読む → - 論文VLAロボティクス
PAPO-VLA: 計画を考慮した視覚言語行動モデルのポリシー最適化
VLAモデルの実行を計画と実行の二役に分解し、計画アクションを特定して重要度を推定し、GRPOの利点推定に組み込むことで、タスク成功に重要な行動を重点的に最適化する手法を提案した。
原題: PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models / Peizheng Guo, Jingyao Wang, Changwen Zheng 他
日本語で読む → - 論文ナビゲーション/VLAロボティクス
ウェイポイントを超えて:クロスエンボディメント意味的ナビゲーションのためのデュアルヒートマップ接地
オープンエンドな意味的指示を物理的に実行可能な局所目標に変換する際、単一点回帰の代わりに到達可能領域と向き制約を表すデュアルヒートマップを予測するVLAフレームワークを提案し、多様なロボットでの性能向上を示した。
原題: Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation / Kaijie Yun, Yue Chen
日本語で読む → - 論文群制御ロボティクス
多様な空中タスクのための自己組織化モジュール型空中ロボット
飛行中に自己組織化して協調操作を行う再構成可能なモジュール型空中ロボットLEGIONを提案し、機敏な飛行と頑健な空中操作のトレードオフを解消する。
原題: Self-assembling Modular Aerial Robot for Versatile Aerial Tasks / Junichiro Sugihara, Masaki Kitagawa, Jinjie Li 他
日本語で読む → - 論文データ生成ロボティクス
FlyMirage:生成的世界モデルによる多様でスケーラブルなUAV飛行データの完全自動生成パイプライン
大規模言語モデルと生成的世界モデルを組み合わせ、高忠実度の3DGSシーンを自動生成し、UAVの飛行軌道を計画することで、多様で現実的な空中VLNデータセットを自動構築するパイプラインを提案した。
原題: FlyMirage: A Fully Automated Generation Pipeline for Diverse and Scalable UAV Flight Data via Generative World Model / Jinhan Li, Xijie Huang, Zhaoqi Wang 他
日本語で読む → - 論文接触状態推定ロボティクス
接触モードとスパース則回復のためのサポート安全な変分ハイブリッドフィルタリング
接触を伴うロボットのハイブリッドダイナミクスにおいて、観測が複数の接触状態に対応する場合でも分岐を失わないよう、学習した提案分布と実行可能な遷移則を混合する変分フィルタVHYDROを提案した。
原題: Support-Safe Variational Hybrid Filtering for Contact-Mode and Sparse-Law Recovery / Marios Papamichalis, Regina Ruane
日本語で読む → - 論文水中ロボット/フォールトトレラント制御ロボティクス
LASSAアーキテクチャに基づく無人水中機の自律フォールトトレラント制御
大規模言語モデル(LLM)を用いて未知の故障を自律的に検出・再計画し、物理制約検証により幻覚を抑制する無人水中機の知的フォールトトレラント制御手法を提案した。
原題: LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles / Hong Chen, Zixiang Tang, Yuanbao Chen 他
日本語で読む → - 論文センサフュージョンeess.SP
拡散生成学習によるMEMS IMUの性能限界克服
低コストIMUの測定値から高精度な仮想IMUデータを生成する拡散モデルを提案し、ナビゲーション精度を向上させた。
原題: Overcoming the Intrinsic Performance Limitations of MEMS IMU via Diffusion-Based Generative Learning / Jiarui Lv, Feng Zhu, Xiaohong Zhang
日本語で読む → - 論文軌道予測ロボティクス
CVAEによるマルチモーダル歩行者軌道予測の改善:ベンチマークとロボットデータの研究
Social-STGCNNにCVAEを組み合わせ、歩行者の多様な未来軌道を確率的に予測する手法を提案し、公開ベンチマークと実ロボット収集データで評価した。
原題: On Improving Multimodal Pedestrian Trajectory Prediction with CVAE: A Study on Benchmark and Robot Data / Yuzhou Liu, Cristina Olaverri-Monreal
日本語で読む → - 論文軌道最適化ロボティクス
ミスマッチを考慮した適応的制約タイトニングによる自転車モデル軌道最適化
自動運転の軌道最適化で使われる自転車モデルと実車両の動的差異による安全違反を防ぐため、モデルミスマッチの理論解析に基づき、速度と曲率に依存する適応的な制約マージン(MACT)を提案した。
原題: Mismatch-Aware Adaptive Constraint Tightening for Bicycle-Model Trajectory Optimization / Lingxue Lyu, Zihui Liu
日本語で読む → - 論文自動運転シミュレーションcs.MA
SceneFactory: GPU高速化による物理ベース車両ダイナミクスを備えたマルチエージェント運転シミュレータ
NVIDIA Isaac Sim/Isaac Lab上に、GPUベクトル化された物理ベースのマルチエージェント運転シミュレータを構築し、Waymoデータセットの道路をUSD世界に変換して多数のシナリオを並列実行、物理精度とスループットの両立を実現した。
原題: SceneFactory: GPU-Accelerated Multi-Agent Driving Simulation with Physics-Based Vehicle Dynamics / Yicheng Zhu, Yang Chen, Tao Li 他
日本語で読む → - 論文VLAロボティクス
ジェスチャー対応視覚言語行動モデルGesVLA:埋め込み表現による操作精度の向上
テキスト指示だけでは曖昧な空間指示を解決するため、ジェスチャーを並列指示として取り入れ、潜在空間に直接エンコードする視覚言語行動モデルGesVLAを提案した。実世界のロボット操作タスクで、複雑な環境での目標把握精度と対話効率が向上することを示した。
原題: GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations / Wenxuan Guo, Ziyuan Li, Meng Zhang 他
日本語で読む → - 論文LiDAR生成画像認識
OmniLiDAR: マルチドメイン3D LiDAR生成のための統一拡散フレームワーク
異なるセンサー条件やプラットフォームにわたる8つのドメインでLiDARスキャンを生成する統一テキスト条件付き拡散モデルを提案し、ドメイン間の特徴シフトを扱う新しいトレーニング戦略と特徴変調を導入した。
原題: OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation / Youquan Liu, Weidong Yang, Ao Liang 他
日本語で読む → - 論文カメラ姿勢推定画像認識
WristCompass: 手首の運動学的連成を学習可能な視覚概念として用いた自己カメラ姿勢推定
手で隠れたシーンから自己カメラの向きを推定する際、手首の動きとカメラ姿勢の運動学的連成を学習することで、大規模シーン再構成モデルを凌ぐ精度を少数パラメータで達成した。
原題: WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation / Varun Nair, Vidyut Baradwaj, Jiahang He 他
日本語で読む → - 論文操作/ベンチマークロボティクス
DexHoldem: 巧みな身体システムによるテキサス・ホールデムのプレイ
実世界の巧みな操作システムを評価するためのベンチマークDexHoldemを提案。ShadowHandを用いたテキサス・ホールデムの操作プリミティブの実行と、エージェントがゲーム状態を認識する能力を評価する。
原題: DexHoldem: Playing Texas Hold'em with Dexterous Embodied System / Feng Chen, Tianzhe Chu, Li Sun 他
日本語で読む →