論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ナビゲーションロボティクス
P$^{3}$Nav: 視覚と言語によるナビゲーションのためのエンドツーエンドの知覚・予測・計画
視覚と言語によるナビゲーション(VLN)タスクにおいて、知覚・予測・計画を統合したエンドツーエンドのフレームワークを提案し、シーン理解を強化してナビゲーション成功率を向上させた。
原題: P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation / Tianfu Li, Wenbo Chen, Haoxuan Xu 他
日本語で読む → - 論文ナビゲーションロボティクス
E-SocialNav: 言語モデルを用いた効率的な社会的規範準拠ナビゲーション
ロボットナビゲーションにおける社会的規範遵守を評価し、小型データセットで訓練した効率的な言語モデルE-SocialNavを提案。GPT-4o等の大規模モデルより高速で、社会的行動生成性能が高い。
原題: E-SocialNav: Efficient Socially Compliant Navigation with Language Models / Ling Xiao, Daeun Song, Xuesu Xiao 他
日本語で読む → - 論文ナビゲーションロボティクス
エッジハードウェア上での鉱山内四足ロボットの効率的自律ナビゲーション
GPUやネットワークを必要としない低消費電力エッジコンピュータ上で動作する、鉱山内の四足ロボット向け完全自律ナビゲーションシステムを提案し、実地試験で100%の成功率を達成した。
原題: Efficient Autonomous Navigation of a Quadruped Robot in Underground Mines on Edge Hardware / Yixiang Gao, Kwame Awuah-Offei
日本語で読む → - 論文ナビゲーションロボティクス
CeRLP: クロスエンボディメントロボットの視覚ナビゲーションのためのローカルプランニングフレームワーク
異なるロボットやカメラ構成でも動作する視覚ナビゲーションのためのローカルプランニングフレームワークを提案し、深度推定のスケール補正と視覚情報のレーザースキャンへの抽象化により、ロボットの形状差を吸収する。
原題: CeRLP: A Cross-embodiment Robot Local Planning Framework for Visual Navigation / Haoyu Xi, Mingao Tan, Xinming Zhang 他
日本語で読む → - 論文社会的ナビゲーションロボティクス
社会的ナビゲーションロボットの人間の知覚を予測・改善するための因果的アプローチ
移動ロボットに対する人間の能力や意図の知覚を予測する因果ベイジアンネットワークを提案し、組み合わせ探索によりロボットの行動を改善する手法を導入した。
原題: A Causal Approach to Predicting and Improving Human Perceptions of Social Navigation Robots / Maximilian Diehl, Nathan Tsoi, Gustavo Chavez 他
日本語で読む → - 論文ナビゲーションロボティクス
eNavi: 低照度屋内移動ロボットナビゲーションのためのイベントベース模倣ポリシー
イベントカメラとRGBを融合した模倣学習ポリシーを提案し、低照度環境での人物追従ナビゲーションの堅牢性を向上させた。
原題: eNavi: Event-based Imitation Policies for Low-Light Indoor Mobile Robot Navigation / Prithvi Jai Ramesh, Kaustav Chanda, Krishna Vinod 他
日本語で読む → - 論文ナビゲーションロボティクス
生涯学習型身体化ナビゲーション学習
大規模言語モデルを用いた身体化ナビゲーションエージェントが、複数のタスクを連続的に学習しながらも過去の知識を保持できる生涯学習フレームワークUni-Walkerを提案した。
原題: Lifelong Embodied Navigation Learning / Xudong Wang, Jiahua Dong, Baichen Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
AERR-Nav: ゼロショット物体ナビゲーションのための適応的探索・回復・回想戦略
未知の多階建て環境でのゼロショット物体ナビゲーションを改善するため、ロボットの状態を動的に切り替える適応的戦略と、高速・低速思考モードを備えた探索状態を提案した。
原題: AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation / Jingzhi Huang, Junkai Huang, Haoyang Yang 他
日本語で読む → - 論文探索/ナビゲーション画像認識
GSMem: 3Dガウススプラッティングを永続的空間記憶として用いたゼロショット身体化探索と推論
3Dガウススプラッティングを永続的な空間記憶として活用し、エージェントが初期観察で見逃した対象を後から再観察できるようにする、ゼロショットの身体化探索・推論フレームワークを提案した。
原題: GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning / Yiren Lu, Yi Du, Disheng Liu 他
日本語で読む → - 論文意味的ナビゲーションロボティクス
移動ロボットの意味的ナビゲーションのための推論システム
意味的概念に基づく環境モデルを構築し、関係データベースとKnowRobを用いた2つの推論システムを比較して、移動ロボットでの実装を示した。
原題: Reasoning Systems for Semantic Navigation in Mobile Robots / Jonathan Crespo, Ramón Barber, O. M. Mozos 他
日本語で読む → - 論文視覚言語モデル/ナビゲーション支援画像認識
視覚障害者向けナビゲーション支援におけるVLMの活用可能性の探求
視覚障害者(pBLV)のナビゲーション支援における視覚言語モデル(VLM)の性能を、閉域・オープンソースモデルを比較評価し、空間推論やシーン理解の課題と可能性を明らかにした。
原題: Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision / Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher 他
日本語で読む → - 論文ナビゲーションロボティクス
車いす向け社会的認識と透明性を備えた自律移動ナビゲーションフレームワーク
車いす利用者のための自律移動システムに、大規模言語モデルを用いて他者の意図を予測し社会的状況を認識する意思決定機構と、各経由点での判断理由をテキストで提示する透明性機能を統合したフレームワークを提案し、シミュレーションで評価した。
原題: SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs / Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock 他
日本語で読む → - 論文ナビゲーション画像認識
MWM: 行動条件付き一貫予測のためのモバイルワールドモデル
ナビゲーションのためのワールドモデルにおいて、行動条件付きの一貫性を向上させる2段階学習と蒸留手法を提案し、画像目標ナビゲーションの性能を改善した。
原題: MWM: Mobile World Models for Action-Conditioned Consistent Prediction / Han Yan, Zishang Xiang, Zeyu Zhang 他
日本語で読む → - 論文ナビゲーションロボティクス
テスト駆動型エージェントフレームワークによる信頼性の高いロボットコントローラの合成
2Dマップや3Dシミュレーション環境で、テスト駆動のエージェントフレームワークを用いて低レベルナビゲーションコントローラのコードを反復的に改良し、信頼性と堅牢性を向上させる手法を提案した。
原題: Test-Driven Agentic Framework for Reliable Robot Controller / Shivanshu Tripathi, Reza Akbarian Bafghi, Maziar Raissi
日本語で読む → - 論文ナビゲーションロボティクス
DreamToNav: 生成ビデオ計画によるロボットの汎用ナビゲーション
生成ビデオモデルを計画エンジンとして使い、自然言語指示からロボットの動作を合成し、その映像から軌道を抽出して実機で実行するナビゲーションフレームワークを提案した。
原題: DreamToNav: Generalizable Navigation for Robots via Generative Video Planning / Valerii Serpiva, Jeffrin Sam, Chidera Simon 他
日本語で読む → - 論文ナビゲーションロボティクス
SFCo-Nav: 低速LLMと高速属性グラフ整列の協調による効率的なゼロショット視覚言語ナビゲーション
視覚言語ナビゲーション(VLN)のゼロショット手法を高速化するため、低速LLMプランナーと高速反応ナビゲーターを非同期に協調させ、必要時のみLLMを起動するフレームワークを提案した。
原題: SFCo-Nav: Efficient Zero-Shot Visual Language Navigation via Collaboration of Slow LLM and Fast Attributed Graph Alignment / Chaoran Xiong, Litao Wei, Xinhao Hu 他
日本語で読む → - 論文ナビゲーションロボティクス
OnFly: 機上ゼロショット空中視覚言語ナビゲーションの安全性と効率性の向上
UAVが自然言語指示に従って3D環境をナビゲートするゼロショットAVLNのための、完全機上・リアルタイムフレームワークOnFlyを提案。デュアルエージェントアーキテクチャとセマンティック幾何検証器により、安全性と効率性を両立し、シミュレーションで成功率を大幅に向上させた。
原題: OnFly: Onboard Zero-Shot Aerial Vision-Language Navigation toward Safety and Efficiency / Guiyong Zheng, Yueting Ban, Mingjie Zhang 他
日本語で読む → - 論文ナビゲーションロボティクス
複合ニューラル制御バリア関数による動的環境下でのロボットナビゲーション
動的環境での安全なロボットナビゲーションのため、複数のニューラルCBFを組み合わせた複合CBFを提案し、オフラインの到達可能性解析で訓練して安全な動作を実現した。
原題: CN-CBF: Composite Neural Control Barrier Function for Robot Navigation in Dynamic Environments / Bojan Derajić, Sebastian Bernhard, Wolfgang Hönig
日本語で読む → - 論文ナビゲーションロボティクス
不均一な可視性を持つ不確実環境でのナビゲーション
不確実な接続性を持つ環境で、移動コストと情報収集のバランスを取りながらナビゲーションする新しいヒューリスティックアルゴリズムを提案した。
原題: Navigating in Uncertain Environments with Heterogeneous Visibility / Jongann Lee, Melkior Ornik
日本語で読む → - 論文ナビゲーションロボティクス
ReMemNav: ゼロショット物体ナビゲーションのための再考とメモリ拡張フレームワーク
視覚言語モデルの空間的幻覚や局所探索のデッドロックを解決するため、パノラマ意味情報とエピソード記憶を統合した階層型ナビゲーションフレームワークReMemNavを提案した。
原題: ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation / Feng Wu, Wei Zuo, Wenliang Yang 他
日本語で読む → - 論文視覚言語ナビゲーションAI
RAGNav: マルチゴール視覚言語ナビゲーションのための検索拡張トポロジカル推論フレームワーク
マルチゴールVLNタスク向けに、低レベルトポロジカルマップと高レベル意味フォレストを統合したデュアルベーシスメモリと、アンカー誘導条件付き検索・トポロジカル近傍スコア伝播機構を備えたRAGNavを提案し、空間的幻覚と計画ドリフトを軽減してSOTA性能を達成した。
原題: RAGNav: A Retrieval-Augmented Topological Reasoning Framework for Multi-Goal Visual-Language Navigation / Ling Luo, Qiangian Bai
日本語で読む → - 論文ナビゲーションロボティクス
NavThinker: 社会的ナビゲーションにおける結合予測と計画のための行動条件付きワールドモデル
ロボットの行動に応じて将来のシーンと歩行者動態を予測する行動条件付きワールドモデルを強化学習と組み合わせ、社会的ナビゲーションの性能を向上させた。
原題: NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation / Tianshuai Hu, Zeying Gong, Lingdong Kong 他
日本語で読む → - 論文ナビゲーションロボティクス
SpatialAnt: 能動的なシーン再構築と視覚的予測による自律ゼロショットロボットナビゲーション
ロボットが未知環境を事前探索して自己構築した不完全な3D再構築を用いて、ゼロショットで言語指示によるナビゲーションを実現するフレームワークを提案した。物理的接地によるスケール回復と視覚的予測による経路の反実仮想推論で性能を向上させた。
原題: SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation / Jiwen Zhang, Xiangyu Shi, Siyuan Wang 他
日本語で読む → - 論文ナビゲーション/マルチエージェント画像認識
ピア観察は役立つのか?視覚言語ナビゲーションのための視覚共有コラボレーション
複数のロボットが同じ環境をナビゲートする際、互いの観察情報を共有することで視覚言語ナビゲーションの性能が向上するかを検証するフレームワークCo-VLNを提案し、R2Rベンチマークで効果を実証した。
原題: Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation / Qunchao Jin, Yiliao Song, Qi Wu
日本語で読む → - 論文VLA/UAVナビゲーション画像認識
AerialVLA: 最小限のエンドツーエンド制御によるUAVナビゲーションのための視覚言語行動モデル
UAVナビゲーションのための視覚言語行動モデルを提案し、生の視覚情報と言語指示を直接連続的な物理制御信号にマッピングする。オラクルガイダンスや外部物体検出器に依存せず、ファジーな方向指示と統合制御空間により、未見環境での汎化性能を大幅に向上させた。
原題: AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control / Peng Xu, Zhengnan Deng, Jiayan Deng 他
日本語で読む → - 論文ナビゲーションロボティクス
視覚言語モデルによる動的制御バリア関数の調整:安全・適応・リアルタイムな視覚ナビゲーション
ロボットのナビゲーションにおいて、視覚言語モデル(VLM)がカメラ画像からリスクを推定し、制御バリア関数(CBF)の安全フィルタの保守性をリアルタイムに調整するフレームワークAlphaAdjを提案。固定パラメータと比較して効率を最大18.5%向上させつつ衝突回避を維持する。
原題: Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation / Jeffrey Chen, Rohan Chandra
日本語で読む → - 論文ナビゲーションロボティクス
PM-Nav: 事前地図誘導による機能建築物内の具現化ナビゲーション
機能建築物内での言語駆動ナビゲーションの課題に対し、環境地図をナビゲーション用の意味的事前地図に変換し、階層的思考連鎖プロンプトとマルチモデル協調行動出力機構を用いて経路計画と実行制御を行うPM-Navを提案した。
原題: PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings / Jiang Gao, Xiangyu Dong, Haozhou Li 他
日本語で読む → - 論文ナビゲーションロボティクス
CATNAV: キャッシュ型視覚言語走破性による効率的なゼロショットロボットナビゲーション
マルチモーダルLLMを用いて、ロボットの身体性を考慮したコストマップをゼロショットで生成し、視覚意味キャッシュによりオンライン推論を85.7%削減するナビゲーションフレームワークを提案。四足ロボットで屋内・屋外の5タスクで高い成功率と制約違反の低減を実証した。
原題: CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation / Aditya Potnis, Francisco Affonso, Shreya Gummadi 他
日本語で読む → - 論文データセット/オフロードナビゲーションロボティクス
STONEデータセット:オフロードロボットナビゲーションのためのスケーラブルなマルチモーダル全方位3D走行可能性データセット
オフロードナビゲーション向けに、自動パイプラインで生成した3D走行可能性マップと、128ch LiDAR・6台のRGBカメラ・3台の4Dイメージングレーダーによる全方位センシングを備えた大規模マルチモーダルデータセットを構築し、ベンチマークを提供した。
原題: STONE Dataset: A Scalable Multi-Modal Surround-View 3D Traversability Dataset for Off-Road Robot Navigation / Konyul Park, Daehun Kim, Jiyong Oh 他
日本語で読む → - 論文ナビゲーションロボティクス
安全なロボットナビゲーションのためのハードウェア高速化ベイズ推論による高速な信頼度考慮型人間予測
GPUで並列化したベイズ推論により、人間の将来軌道を粒子として高周波(125Hz)で予測し、複数人環境での安全なロボットナビゲーションを実現した。
原題: Fast Confidence-Aware Human Prediction via Hardware-accelerated Bayesian Inference for Safe Robot Navigation / Michael Lu, Minh Bui, Xubo Lyu 他
日本語で読む →