論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文水中ロボットロボティクス
水中ロボットの身体化知能:計画・制御・展開における制約連成の視点
水中ロボットの自律性を阻む物理的制約(流体力学的不確実性、部分観測性、通信帯域、エネルギー制約)が相互に連成する問題を整理し、強化学習や信念計画、ハイブリッド制御などの最新手法を統合するレビュー論文。
原題: Underwater Embodied Intelligence for Autonomous Robots: A Constraint-Coupled Perspective on Planning, Control, and Deployment / Jingzehua Xu, Guanwen Xie, Jiwei Tang 他
日本語で読む → - 論文制御ロボティクス
船上クレーンの二重振り子揺れ抑制のためのオンボードMuJoCoベースモデル予測制御
船上クレーンの二重振り子揺れを抑制するため、MuJoCoシミュレータ上でクロスエントロピー法を用いたモデル予測制御をリアルタイムに実行するパイプラインを提案した。
原題: Onboard MuJoCo-based Model Predictive Control for Shipboard Crane with Double-Pendulum Sway Suppression / Oscar Pang, Lisa Coiffard, Paul Templier 他
日本語で読む → - 論文敵対的攻撃ロボティクス
DTP-Attack: 軌道予測に対する決定ベースのブラックボックス敵対的攻撃
軌道予測システムに対する、勾配情報を必要としない決定ベースのブラックボックス敵対的攻撃フレームワークを提案し、意図誤分類攻撃と精度劣化攻撃の両方を実現した。
原題: DTP-Attack: A decision-based black-box adversarial attack on trajectory prediction / Jiaxiang Li, Jun Yan, Daniel Watzenig 他
日本語で読む → - 論文シミュレーションロボティクス
Kamino: GPUベースの大規模並列マルチボディシミュレーション - 複雑なトポロジーへの対応
GPU上で複雑な機械的結合(閉ループなど)を持つ多体系を高速に並列シミュレーションする物理ソルバーを提案し、強化学習による歩行ポリシー学習を実証した。
原題: Kamino: GPU-based Massively Parallel Simulation of Multi-Body Systems with Challenging Topologies / Vassilios Tsounis, Guirec Maloisel, Christian Schumacher 他
日本語で読む → - 論文シミュレーションロボティクス
CARLA-Air: CARLA世界でのドローン飛行--空陸具現知能のための統合基盤
CARLAとAirSimを単一のUnreal Engineプロセス内で統合し、都市運転とマルチローター飛行を物理的に一貫した環境で同時にシミュレートするオープンソース基盤を提案した。
原題: CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence / Tianle Zeng, Yanci Wen, Hong Zhang
日本語で読む → - 論文VLA機械学習
推論効率から身体効率へ:Vision-Language-Actionモデルの効率指標の再検討
VLAモデルの効率をパラメータ数やFLOPsではなく、タスク完了時間や軌道の滑らかさなど実機での身体的行動で評価すべきだと示し、従来の効率化手法が実機性能を必ずしも向上させないことを実験的に明らかにした。
原題: From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models / Zhuofan Li, Hongkun Yang, Zhenyang Chen 他
日本語で読む → - 論文sim2realロボティクス
適応的力差量子化による低解像度観測を用いた堅牢な布地解しのシミュレーションから実世界への転移
布地解しタスクにおいて、力の正確な値ではなく粗い変化パターンに着目し、力入力を離散化した時間差分と状態依存の量子化閾値で表現する手法を提案。シミュレーションと実世界の両方で成功率と堅牢性が向上することを示した。
原題: Robust Sim-to-Real Cloth Untangling through Reduced-Resolution Observations via Adaptive Force-Difference Quantization / Yoshihisa Tsurumine, Yuki Kadokawa, Kohei Hayashi 他
日本語で読む → - 論文VLA画像認識
VLA-Thinker: 画像思考による視覚言語行動モデルの性能向上
視覚入力を動的に再参照できる思考フレームワークを導入し、2段階学習でロボット操作性能を大幅に向上させた。
原題: VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning / Chaoyang Wang, Wenrui Bao, Sicheng Gao 他
日本語で読む → - 論文マニピュレーションロボティクス
GraspALL: 任意の低照度環境下でのロボット衣類把持のための照明変動適応型構造補償
照明が動的に変化する低照度環境でもロバストに衣類を把持できるよう、RGBと非RGBモダリティの特徴を照明強度に応じて適応的に融合するモデルGraspALLを提案した。
原題: GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions / Haifeng Zhong, Wenshuo Han, Zhouyu Wang 他
日本語で読む → - 論文幾何推定画像認識
ロバストかつ閾値耐性のある幾何推定のための大域打ち切り損失最小化
外れ値にロバストな幾何推定のため、大域的分岐限定法(BnB)を用いて打ち切り損失(TL)を初めて統一的に最小化するフレームワークGTMを提案した。探索空間削減とLipschitz連続なバウンド関数により高速化を実現している。
原題: Global Truncated Loss Minimization for Robust and Threshold-Resilient Geometric Estimation / Tianyu Huang, Liangzu Peng, Xinyue Zhang 他
日本語で読む → - 論文ナビゲーションロボティクス
視覚言語モデルによる動的制御バリア関数の調整:安全・適応・リアルタイムな視覚ナビゲーション
ロボットのナビゲーションにおいて、視覚言語モデル(VLM)がカメラ画像からリスクを推定し、制御バリア関数(CBF)の安全フィルタの保守性をリアルタイムに調整するフレームワークAlphaAdjを提案。固定パラメータと比較して効率を最大18.5%向上させつつ衝突回避を維持する。
原題: Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation / Jeffrey Chen, Rohan Chandra
日本語で読む → - 論文ナビゲーション画像認識
LatentPilot: 潜在視覚推論による先読みでシーンを理解する視覚言語ナビゲーション
未来の観測を訓練時に活用して行動条件付き視覚ダイナミクスを学習し、推論時には未来フレームを使わずに潜在トークンで先読み推論を行う新しいVLNパラダイムを提案し、ベンチマークと実ロボットでSOTAを達成した。
原題: LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning / Haihong Hao, Lei Chen, Mingfei Han 他
日本語で読む → - 論文動作予測ロボティクス
安全な人間ロボット協調のためのガウス過程によるスケーラブルな確率的人間動作予測
人間の全身動作予測を、不確実性を適切に捉えつつスケーラブルに行うため、構造化マルチタスク変分ガウス過程フレームワークを提案した。
原題: Towards Scalable Probabilistic Human Motion Prediction with Gaussian Processes for Safe Human-Robot Collaboration / Jinger Chong, Xiaotong Zhang, Kamal Youcef-Toumi
日本語で読む → - 論文ナビゲーションロボティクス
IntentReact: トポロジカルな意図による反応的オブジェクト中心ナビゲーションの誘導
オブジェクト目標ナビゲーションにおいて、局所的な観測のみに依存する反応的制御と大域的なトポロジカル計画のギャップを埋めるため、意図(intent)と呼ばれる低次元の方向信号を導入し、学習されたウェイポイント予測を条件付けてナビゲーションを誘導するフレームワークを提案した。
原題: IntentReact: Guiding Reactive Object-Centric Navigation via Topological Intent / Yanmei Jiao, Anpeng Lu, Wenhan Hu 他
日本語で読む → - 論文視覚言語ナビゲーションAI
RAGNav: マルチゴール視覚言語ナビゲーションのための検索拡張トポロジカル推論フレームワーク
マルチゴールVLNタスク向けに、低レベルトポロジカルマップと高レベル意味フォレストを統合したデュアルベーシスメモリと、アンカー誘導条件付き検索・トポロジカル近傍スコア伝播機構を備えたRAGNavを提案し、空間的幻覚と計画ドリフトを軽減してSOTA性能を達成した。
原題: RAGNav: A Retrieval-Augmented Topological Reasoning Framework for Multi-Goal Visual-Language Navigation / Ling Luo, Qiangian Bai
日本語で読む → - 論文安全工学AI
能力の影:安全工学におけるAI支援の理論と限界
AI支援が安全工学の分析品質を向上させるのか、それとも系統的な盲点を生むのかを形式化し、能力の影という概念を導入して、協調構造に応じた性能限界を導出した論文。
原題: The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering / Umair Siddique
日本語で読む → - 論文マニピュレーションロボティクス
単一視点点群からのエンドツーエンド器用把持学習:多物体シーンデータセットによるアプローチ
多物体シーンでの器用な把持を実現するため、単一視点の点群から把持構成を直接予測するエンドツーエンドネットワークDGS-Netと、それを訓練するための多物体シーンデータセットを提案した。
原題: End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset / Tao Geng, Dapeng Yang, Ziwei Liu 他
日本語で読む → - 論文シミュレーションロボティクス
粒子ベースシミュレーションにおける物理的に正確な剛体ダイナミクス
粒子ベースのシミュレータであるPBDを改良し、運動量保存制約と速度更新の修正により物理的に正確な剛体ダイナミクスを実現するPBD-Rを提案した。解析解を持つベンチマークで評価し、PBDを大幅に上回り、MuJoCoと同等の精度を少ない計算量で達成した。
原題: Physically Accurate Rigid-Body Dynamics in Particle-Based Simulation / Ava Abderezaei, Nataliya Nechyporenko, Joseph Miceli 他
日本語で読む → - 論文マニピュレーションロボティクス
AdaClearGrasp: 密集環境でのロバストなゼロショット器用把持のための適応的クリアリング学習
密集環境での器用な把持を実現するため、視覚言語モデルを用いて直接把持するか周囲をクリアするかを適応的に決定する閉ループ意思決定・実行フレームワークを提案した。
原題: AdaClearGrasp: Learning Adaptive Clearing for Zero-Shot Robust Dexterous Grasping in Densely Cluttered Environments / Zixuan Chen, Wenquan Zhang, Jing Fang 他
日本語で読む → - 論文自己再設計ロボティクス
運動学的自己破壊による自己再設計ロボット
ロボットが自身の身体を動的に再設計する手法を提案。冗長なリンクを自己破壊して除去し、移動性能を向上させる。
原題: Robots that redesign themselves through kinematic self-destruction / Chen Yu, Sam Kriegman
日本語で読む → - 論文データセット/ベンチマークロボティクス
LARD 2.0: 自律着陸システムのための拡張データセットとベンチマーキング
自律着陸システムの物体検出モデル訓練用データセットLARDを拡張し、多様な画像ソースの追加や現実的なシナリオへの改良、複数滑走路環境でのベンチマークフレームワークを提供した論文。
原題: LARD 2.0: Enhanced Datasets and Benchmarking for Autonomous Landing Systems / Yassine Bougacha, Geoffrey Delhomme, Mélanie Ducoffe 他
日本語で読む → - 論文ビジョンシステム画像認識
惑星探査ローバーのための深層学習支援ビジョンシステム
惑星探査ローバー向けに、リアルタイム認識とオフライン地形再構成を組み合わせたビジョンシステムを提案し、月面画像での距離推定精度を評価した。
原題: Deep Learning Aided Vision System for Planetary Rovers / Lomash Relia, Jai G Singla, Amitabh 他
日本語で読む → - 論文群制御ロボティクス
シーン適応型具現化知能に基づくマルチAUVアドホックネットワークによるマルチターゲット追跡
動的で帯域制約のある水中環境で、AUVを具現化エージェントとして統合し、シーン適応型MARLアルゴリズムによりマルチターゲット追跡を実現する新しいアーキテクチャを提案した。
原題: Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence / Kai Tian, Jialun Wang, Chuan Lin 他
日本語で読む → - 論文場所認識画像認識
4DRaL: 知識蒸留による4DレーダーとLiDARを橋渡しする場所認識
4Dレーダーの場所認識性能を向上させるため、高性能なLiDARベースのモデルを教師として知識蒸留を用いるフレームワーク4DRaLを提案した。
原題: 4DRaL: Bridging 4D Radar with LiDAR for Place Recognition using Knowledge Distillation / Ningyuan Huang, Zhiheng Li, Zheng Fang
日本語で読む → - 論文自動運転ロボティクス
ユーザーは走行速度を指定できるか? Bench2Drive-Speed: 所望速度条件付き自動運転のためのベンチマークとベースライン
自動運転において、ユーザーが希望する速度や追い越し可否を指定できるようにするためのベンチマークとデータセット、ベースラインモデルを提案した論文。
原題: Can Users Specify Driving Speed? Bench2Drive-Speed: Benchmark and Baselines for Desired-Speed Conditioned Autonomous Driving / Yuqian Shao, Xiaosong Jia, Langechuan Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
eNavi: 低照度屋内移動ロボットナビゲーションのためのイベントベース模倣ポリシー
イベントカメラとRGBを融合した模倣学習ポリシーを提案し、低照度環境での人物追従ナビゲーションの堅牢性を向上させた。
原題: eNavi: Event-based Imitation Policies for Low-Light Indoor Mobile Robot Navigation / Prithvi Jai Ramesh, Kaustav Chanda, Krishna Vinod 他
日本語で読む → - 論文状態推定ロボティクス
無人地上車両ナビゲーションのためのハイブリッドニューラル支援アンセンテッドカルマンフィルタ
慣性センサとGNSSの融合に用いるUKFのノイズ共分散を、シミュレーションデータのみで訓練した深層ニューラルネットワークが実測値から予測するハイブリッド推定手法を提案し、3データセットで位置精度を向上させた。
原題: A Hybrid Neural-Assisted Unscented Kalman Filter for Unmanned Ground Vehicle Navigation / Gal Versano, Itzik Klein
日本語で読む → - 論文移動操作ロボティクス
非構造化・半静的環境における逐次移動操作のための知覚的階層タスクMPC
逐次移動操作タスクを非構造化で変化する環境で効率的に実行するため、ベイズ推論で環境変化をモデル化し、階層タスクMPCに組み込む新しいフレームワークを提案した。シミュレーションと実機実験で有効性を検証した。
原題: Perceptive Hierarchical-Task MPC for Sequential Mobile Manipulation in Unstructured Semi-Static Environments / Xintong Du, Jingxing Qian, Siqi Zhou 他
日本語で読む → - 論文医用画像処理ロボティクス
ACCURATE: ロバストな適応的二視点推定に基づく任意形状連続体の再構成
X線画像からガイドワイヤやカテーテルなどの任意形状の連続体を高精度に3次元再構成するフレームワークを提案した。
原題: ACCURATE: Arbitrary-shaped Continuum Reconstruction Under Robust Adaptive Two-view Estimation / Yaozhi Zhang, Shun Yu, Yugang Zhang 他
日本語で読む → - 論文VLAロボティクス
すべての特徴が平等ではない:視覚言語行動モデルの機構的研究
視覚言語行動(VLA)モデルがマルチモーダル入力を行動に変換する仕組みを、活性化注入やスパースオートエンコーダなどを用いて分析し、視覚経路が行動生成を支配し、言語の重要性はタスク構造に依存することを明らかにした。
原題: Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models / Bryce Grant, Xijia Zhao, Peng Wang
日本語で読む →