論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ナビゲーションロボティクス
osmAG-Nav: 頑健な生涯屋内自律のための階層的意味トポメトリックナビゲーションスタック
大規模・多階層環境でのモバイルロボットナビゲーションのために、階層的意味トポメトリックマップ標準に基づくROS2ナビゲーションスタックを提案し、グローバルなトポロジ推論とローカルなメトリック実行を分離して、効率的な計画とメモリ使用量の削減を実現した。
原題: osmAG-Nav: A Hierarchical Semantic Topometric Navigation Stack for Robust Lifelong Indoor Autonomy / Yongqi Zhang, Jiajie Zhang, Chengqian Li 他
日本語で読む → - 論文ナビゲーションロボティクス
言語条件付き視覚ナビゲーションのためのポリシー誘導型ワールドモデルプランニング
学習済みナビゲーションポリシーと潜在ワールドモデルプランニングを組み合わせた二段階フレームワークPiJEPAを提案し、言語指示に基づく視覚ナビゲーションの性能を向上させた。
原題: Policy-Guided World Model Planning for Language-Conditioned Visual Navigation / Amirhosein Chahe, Lifeng Zhou
日本語で読む → - 論文VLA/ナビゲーション/マニピュレーションロボティクス
DiffusionAnything: 統一ナビゲーションと把持前動作のためのエンドツーエンド・インコンテキスト拡散学習
RGB画像のみから、メートル規模のナビゲーションとセンチメートル規模のマニピュレーションを単一モデルで計画する拡散ポリシーを提案。タスクごとに5分の自己教師ありデータで学習し、未知シーンへのゼロショット汎化を実現する。
原題: DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion / Iana Zhura, Yara Mahmoud, Jeffrin Sam 他
日本語で読む → - 論文ナビゲーションロボティクス
HaltNav: 軽量なトポロジカル事前知識に基づく反応的視覚停止による頑健な視覚言語ナビゲーション
軽量なテキストベースの地図(osmAG)とVLNを組み合わせ、障害物による経路変更をMLLMで検出して再計画する階層型ナビゲーションフレームワークを提案。
原題: HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation / Zihui Yu, Pingcong Li, Bichi Zhang 他
日本語で読む → - 論文ナビゲーションロボティクス
PM-Nav: 事前地図誘導による機能建築物内の具現化ナビゲーション
機能建築物内での言語駆動ナビゲーションの課題に対し、環境地図をナビゲーション用の意味的事前地図に変換し、階層的思考連鎖プロンプトとマルチモデル協調行動出力機構を用いて経路計画と実行制御を行うPM-Navを提案した。
原題: PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings / Jiang Gao, Xiangyu Dong, Haozhou Li 他
日本語で読む → - 論文身体化ナビゲーション/マルチエージェントロボティクス
MA-CoNav: 階層的協調と二重レベル反射を備えた長期的身体化VLNのためのマスター・スレーブ型マルチエージェントフレームワーク
複雑な言語指示に基づく長期的なナビゲーションを実現するため、マスター・スレーブ型の階層的マルチエージェント協調フレームワークを提案し、知覚・計画・実行・記憶を専門エージェントに分散させ、局所・大域の二段階反射機構でパイプラインを最適化した。
原題: MA-CoNav: A Master-Slave Multi-Agent Framework with Hierarchical Collaboration and Dual-Level Reflection for Long-Horizon Embodied VLN / Ling Luo, Qianqian Bai
日本語で読む → - 論文ナビゲーションロボティクス
LLMによる信号時相論理仕様の翻訳と修復を用いた低空UAVの自然言語ナビゲーション
自然言語の指示を信号時相論理(STL)仕様に変換し、混合整数線形計画法で軌道を生成するUAVナビゲーションフレームワークを提案。LLMによる仕様翻訳と、不実行時の仕様修復機構を備える。
原題: LLM-Enabled Low-Altitude UAV Natural Language Navigation via Signal Temporal Logic Specification Translation and Repair / Yuqi Ping, Huahao Ding, Tianhao Liang 他
日本語で読む → - 論文支援技術/ナビゲーションロボティクス
道案内を超えたナビゲーション:視覚障害者との環境インタラクションのためのロボット協調
視覚障害者とロボットが協力し、ドアを開けるなどの環境操作を伴う移動を支援するシステムを提案・評価した論文。
原題: Navigation beyond Wayfinding: Robots Collaborating with Visually Impaired Users for Environmental Interactions / Shaojun Cai, Nuwan Janaka, Ashwin Ram 他
日本語で読む → - 論文ナビゲーションロボティクス
車いす向け社会的認識と透明性を備えた自律移動ナビゲーションフレームワーク
車いす利用者のための自律移動システムに、大規模言語モデルを用いて他者の意図を予測し社会的状況を認識する意思決定機構と、各経由点での判断理由をテキストで提示する透明性機能を統合したフレームワークを提案し、シミュレーションで評価した。
原題: SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs / Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock 他
日本語で読む → - 論文ナビゲーションロボティクス
AgentVLN:エージェント型視覚言語ナビゲーションに向けて
視覚言語ナビゲーション(VLN)のための新しいフレームワークAgentVLNを提案。VLMを高次推論に用い、3Dトポロジカルウェイポイントを画像平面に投影して視覚プロンプトを生成し、自己補正と能動探索で長期的なナビゲーション誤差を抑制する。
原題: AgentVLN: Towards Agentic Vision-and-Language Navigation / Zihao Xin, Wentong Li, Yixuan Jiang 他
日本語で読む → - 論文データセット/オフロードナビゲーションロボティクス
STONEデータセット:オフロードロボットナビゲーションのためのスケーラブルなマルチモーダル全方位3D走行可能性データセット
オフロードナビゲーション向けに、自動パイプラインで生成した3D走行可能性マップと、128ch LiDAR・6台のRGBカメラ・3台の4Dイメージングレーダーによる全方位センシングを備えた大規模マルチモーダルデータセットを構築し、ベンチマークを提供した。
原題: STONE Dataset: A Scalable Multi-Modal Surround-View 3D Traversability Dataset for Off-Road Robot Navigation / Konyul Park, Daehun Kim, Jiyong Oh 他
日本語で読む → - 論文ナビゲーションロボティクス
T2Nav: 代数的位相幾何を考慮した時間グラフメモリとループ検出によるゼロショット視覚ナビゲーション
ゼロショットで視覚ナビゲーションを行うシステムT2Navを提案。視覚情報をグラフに統合し、探索と目標到達のバランスを取ることで、障害物回避やループ検出、経路計画を効率的に行う。
原題: T2Nav Algebraic Topology Aware Temporal Graph Memory and Loop Detection for ZeroShot Visual Navigation / Quang-Anh N. D., Duc Pham, Minh-Anh Nguyen 他
日本語で読む → - 論文視覚言語ナビゲーション画像認識
Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
原題: Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos / Mingfei Han, Haihong Hao, Liang Ma 他
日本語で読む → - 論文ナビゲーション画像認識
LatentPilot: 潜在視覚推論による先読みでシーンを理解する視覚言語ナビゲーション
未来の観測を訓練時に活用して行動条件付き視覚ダイナミクスを学習し、推論時には未来フレームを使わずに潜在トークンで先読み推論を行う新しいVLNパラダイムを提案し、ベンチマークと実ロボットでSOTAを達成した。
原題: LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning / Haihong Hao, Lei Chen, Mingfei Han 他
日本語で読む → - 論文ナビゲーション/マルチエージェント画像認識
ピア観察は役立つのか?視覚言語ナビゲーションのための視覚共有コラボレーション
複数のロボットが同じ環境をナビゲートする際、互いの観察情報を共有することで視覚言語ナビゲーションの性能が向上するかを検証するフレームワークCo-VLNを提案し、R2Rベンチマークで効果を実証した。
原題: Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation / Qunchao Jin, Yiliao Song, Qi Wu
日本語で読む → - 論文探索/ナビゲーション画像認識
GSMem: 3Dガウススプラッティングを永続的空間記憶として用いたゼロショット身体化探索と推論
3Dガウススプラッティングを永続的な空間記憶として活用し、エージェントが初期観察で見逃した対象を後から再観察できるようにする、ゼロショットの身体化探索・推論フレームワークを提案した。
原題: GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning / Yiren Lu, Yi Du, Disheng Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
不均質な群衆中での最適予測ホライズンに基づくソーシャルロボットナビゲーション
群衆中のロボットナビゲーションにおいて、予測ホライズンを固定ではなく社会的文脈に応じて動的に最適化する枠組みを提案し、シミュレーションと実機実験で性能向上を実証した。
原題: Optimal-Horizon Social Robot Navigation in Heterogeneous Crowds / Jiamin Shi, Haolin Zhang, Yuchen Yan 他
日本語で読む → - 論文ナビゲーションロボティクス
GSAT: 自己教師あり学習と異常検知による多様な地形の幾何学的走行可能性推定
ロボットの安全な自律航法のため、自己教師あり学習と異常検知を組み合わせ、負例なしで走行可能領域を分類する新しい手法を提案した。
原題: GSAT: Geometric Traversability Estimation using Self-supervised Learning with Anomaly Detection for Diverse Terrains / Dongjin Cho, Miryeong Park, Juhui Lee 他
日本語で読む → - 論文ナビゲーションロボティクス
不確かさを考慮したロボットナビゲーションのためのガウス混合モデルに基づく逆知覚契約
ガウス混合モデルを用いて知覚誤差の多峰性・非凸性を捉える不確かさ集合を学習し、より安全で保守的でないロボットナビゲーションを実現する手法を提案した。
原題: Gaussian Mixture-Based Inverse Perception Contract for Uncertainty-Aware Robot Navigation / Bingyao Du, Joonkyung Kim, Yiwei Lyu
日本語で読む → - 論文ナビゲーションロボティクス
SaferPath: 学習による誘導と安全制約付き制御を用いた階層的視覚ナビゲーション
既存のエンドツーエンドモデルから得た誘導を、安全制約付き最適化制御モジュールで洗練する階層的視覚ナビゲーションフレームワークを提案し、未見環境での衝突を減らし成功率を向上させる。
原題: SaferPath: Hierarchical Visual Navigation with Learned Guidance and Safety-Constrained Control / Lingjie Zhang, Zeyu Jiang, Changhao Chen
日本語で読む → - 論文ナビゲーションロボティクス
EndoSERV: 視覚ベースの内腔ロボットナビゲーションシステム
内視鏡手術ロボットのナビゲーション精度を向上させるため、管腔構造を分割してオドメトリを推定し、実画像を仮想領域にマッピングしてラベル不足を補う新しい位置推定法を提案した。
原題: EndoSERV: A Vision-based Endoluminal Robot Navigation System / Junyang Wu, Fangfang Xie, Minghui Zhang 他
日本語で読む → - 論文ナビゲーションロボティクス
視覚言語行動モデルには経路逸脱検出のためのアテンションヘッドが既に存在する
凍結したVLAモデルの少数のアテンションヘッドを監視するだけで、追加計算なしに経路逸脱を高精度で検出できることを発見し、検出後は軽量なRLポリシーで復帰させるパイプラインを実機で実証した。
原題: Your Vision-Language-Action Model Already Has Attention Heads For Path Deviation Detection / Jaehwan Jeong, Evelyn Zhu, Jinying Lin 他
日本語で読む → - 論文ナビゲーションロボティクス
SysNav: マルチレベル系統的協調による実世界・クロスエンボディ物体ナビゲーションの実現
実世界の物体ナビゲーションをシステムレベルで捉え、セマンティック推論・ナビゲーション計画・運動制御を分離した3層システムSysNavを提案し、車輪型ロボット、四足、人型の3つの異なるエンボディで実証した。
原題: SysNav: Multi-Level Systematic Cooperation Enables Real-World, Cross-Embodiment Object Navigation / Haokun Zhu, Zongtai Li, Zihan Liu 他
日本語で読む → - 論文社会的ナビゲーションロボティクス
社会的ナビゲーションロボットの人間の知覚を予測・改善するための因果的アプローチ
移動ロボットに対する人間の能力や意図の知覚を予測する因果ベイジアンネットワークを提案し、組み合わせ探索によりロボットの行動を改善する手法を導入した。
原題: A Causal Approach to Predicting and Improving Human Perceptions of Social Navigation Robots / Maximilian Diehl, Nathan Tsoi, Gustavo Chavez 他
日本語で読む → - 論文ナビゲーション画像認識
MWM: 行動条件付き一貫予測のためのモバイルワールドモデル
ナビゲーションのためのワールドモデルにおいて、行動条件付きの一貫性を向上させる2段階学習と蒸留手法を提案し、画像目標ナビゲーションの性能を改善した。
原題: MWM: Mobile World Models for Action-Conditioned Consistent Prediction / Han Yan, Zishang Xiang, Zeyu Zhang 他
日本語で読む → - 論文ナビゲーションロボティクス
生涯学習型身体化ナビゲーション学習
大規模言語モデルを用いた身体化ナビゲーションエージェントが、複数のタスクを連続的に学習しながらも過去の知識を保持できる生涯学習フレームワークUni-Walkerを提案した。
原題: Lifelong Embodied Navigation Learning / Xudong Wang, Jiahua Dong, Baichen Liu 他
日本語で読む → - 論文ナビゲーション/マッピングロボティクス
並列オクトマッピング:自律ナビゲーションにおける経路計画向上のためのスケーラブルなフレームワーク
固定解像度マッピングの過剰保守的な障害物表現による経路計画の失敗を解決するため、並列OctoMapベースのマッピング手法POMPを提案し、自由空間の表現を最大化しつつマルチスレッド計算を実現した。
原題: Parallel OctoMapping: A Scalable Framework for Enhanced Path Planning in Autonomous Navigation / Yihui Mao, Tian Tan, Xuehui Shen 他
日本語で読む → - 論文安全ナビゲーションロボティクス
音リスク認識を組み込んだ制御バリア関数による建設現場でのロボット安全ナビゲーション
建設現場のような動的で見通しの悪い環境で、音から得たリスク情報(削岩機の検出)を制御バリア関数に組み込み、障害物回避の安全性を保証しつつ安全マージンを適応させるナビゲーション手法を提案した。
原題: Control Barrier Functions with Audio Risk Awareness for Robot Safe Navigation on Construction Sites / Johannes Mootz, Reza Akhavian
日本語で読む → - 論文物体ナビゲーションロボティクス
3DGSNav: アクティブ3Dガウシアンスプラッティングによる視覚言語モデルの物体ナビゲーション推論強化
3DガウシアンスプラッティングをVLMの永続メモリとして組み込み、自由視点レンダリングとCoTプロンプトでゼロショット物体ナビゲーションの空間推論を向上させるフレームワークを提案。
原題: 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting / Wancai Zheng, Hao Chen, Xianlong Lu 他
日本語で読む → - 論文ナビゲーションロボティクス
NavDreamer: 動画生成モデルをゼロショット3Dナビゲータとして活用
動画生成モデルを言語指示とナビゲーション軌道のインターフェースとして用い、ゼロショットで3Dナビゲーションを実現するフレームワークを提案。
原題: NavDreamer: Video Models as Zero-Shot 3D Navigators / Xijie Huang, Weiqi Gai, Tianyue Wu 他
日本語で読む →