論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/ナビゲーション画像認識
SpaAct: 空間活性化遷移学習とカリキュラム適応による視覚言語ナビゲーション
視覚言語ナビゲーション(VLN)のためのVLM適応フレームワークSpaActを提案。後方行動推論と前方遷移予測の2つの空間活性化タスクと、TriPAカリキュラム学習により動的空間認識を獲得し、VLN-CEベンチマークでSOTAを達成。
原題: SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation / Pengna Li, Kangyi Wu, Shaoqing Xu 他
日本語で読む → - 論文ナビゲーション画像認識
仮説グラフ精緻化:カスケード誤差修正を伴う仮説駆動探索による身体化ナビゲーション
本論文は、身体化エージェントのナビゲーションにおいて、フロンティア予測を修正可能な仮説ノードとして依存関係を考慮したグラフメモリに表現し、検証駆動のカスケード修正により誤ったサブグラフを刈り取るフレームワーク「HGR」を提案する。
原題: Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation / Peixin Chen, Guoxi Zhang, Jianwei Ma 他
日本語で読む → - 論文ナビゲーションロボティクス
UAVのための視覚・言語ナビゲーション:進展、課題、研究ロードマップ
UAVが人間の高レベルな指示を解釈し複雑な3D環境で長期的なタスクを実行するための視覚・言語ナビゲーション(UAV-VLN)に関する包括的なサーベイ論文。技術の進化を分類し、シミュレーションから実世界への適用における課題を分析し、将来の研究ロードマップを提案している。
原題: Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap / Hanxuan Chen, Jie Zheng, Siqi Yang 他
日本語で読む → - 論文ナビゲーションロボティクス
未知かつ障害物の多い環境における方向認識型凸自由領域生成による安全なナビゲーション
未知で障害物の多い環境でのロボットナビゲーションのために、候補運動方向とロボット形状を考慮した凸自由領域生成と連続安全軌道生成を統合したフレームワークを提案した。
原題: Safe Navigation in Unknown and Cluttered Environments via Direction-Aware Convex Free-Region Generation / Zhicheng Song, Yongjian Li, Kai Chen 他
日本語で読む → - 論文ナビゲーションロボティクス
エッジインテリジェンスに向けた自律ナビゲーション:ロボット支援データ収集アプローチ
複雑な環境でエッジAIのためのデータ収集を行うロボットのナビゲーション手法を提案。通信と学習の性能を同時に最適化する方式で、非見通し環境でも効率的にデータを集められることをシミュレーションで示した。
原題: Towards Edge Intelligence via Autonomous Navigation: A Robot-Assisted Data Collection Approach / Tingting Huang, Yingyang Chen, Sixian Qin 他
日本語で読む → - 論文ナビゲーションロボティクス
FSUNav:高速・安全・汎用的なゼロショット目標指向ナビゲーションのための大脳-小脳アーキテクチャ
視覚言語モデルと強化学習を組み合わせた大脳-小脳アーキテクチャを提案し、異種ロボットでの高速・安全なゼロショット目標ナビゲーションを実現した。
原題: FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation / Mingao Tan, Yiyang Li, Shanze Wang 他
日本語で読む → - 論文ナビゲーション画像認識
FineCog-Nav: 細粒度認知モジュール統合によるゼロショットマルチモーダルUAVナビゲーション
人間の認知プロセスを模倣した細粒度モジュールを統合し、ゼロショットでUAVの視覚言語ナビゲーションを行うフレームワークを提案した論文。
原題: FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation / Dian Shao, Zhengzheng Xu, Peiyang Wang 他
日本語で読む → - 論文ナビゲーション画像認識
スリーステップナビ:ゼロショット視覚言語ナビゲーションのための階層的グローバル・ローカルプランナー
マルチモーダル大規模言語モデルを用いたゼロショット視覚言語ナビゲーションの成功率を向上させるため、前方・現在・後方の3視点で計画する手法を提案した。
原題: Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation / Wanrong Zheng, Yunhao Ge, Laurent Itti
日本語で読む → - 論文ナビゲーションロボティクス
RAY-TOLD: レイベース潜在ダイナミクスによる高密度動的障害物回避とTDMPC
LiDARデータを潜在ダイナミクスに統合し、MPPIと強化学習の長期的予測を組み合わせたハイブリッド制御で、高密度な動的障害物環境での衝突率を低減する手法を提案した。
原題: RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC / Seungho Han, Seokju Lee, Jeonguk Kang
日本語で読む → - 論文ナビゲーションロボティクス
数ステップの視覚ナビゲーションのための修正シュレーディンガーブリッジマッチング
拡散モデルやシュレーディンガーブリッジに基づく生成ポリシーは多峰的な行動分布を捉えられるが、多数の積分ステップが必要でリアルタイム制御に不向きだった。本研究では、エントロピー正則化パラメータを調整し、速度場の構造不変性と分散低減を利用して、少ないステップで高精度な視覚ナビゲーションを実現するRSBMを提案した。
原題: Rectified Schr\"odinger Bridge Matching for Few-Step Visual Navigation / Wuyang Luan, Junhui Li, Weiguang Zhao 他
日本語で読む → - 論文ナビゲーション制御
到達可能集合を用いたニューラル放射場による安全ナビゲーション
ロボットの安全な経路計画のために、障害物の体積表現をNeRFで計算し、到達可能集合と制約付き最適制御を用いて安全な経路を生成する手法を提案した。
原題: Safe Navigation using Neural Radiance Fields via Reachable Sets / Omanshu Thapliyal, Malarvizhi Sankaranarayanasamy, Ravigopal Vennelakanti
日本語で読む → - 論文ナビゲーションAI
WorldMAP: 生成的世界モデルを用いた視覚言語ナビゲーション軌道予測のブートストラップ
生成的世界モデルが生成した未来映像から教師信号を作り、視覚言語入力から直接ナビゲーション軌道を予測する軽量モデルを訓練する教師-学生フレームワークを提案した。
原題: WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models / Hongjin Chen, Shangyun Jiang, Tonghua Su 他
日本語で読む → - 論文ナビゲーションロボティクス
航空ロボットのための視覚言語ナビゲーション:大規模言語モデルの時代に向けて
本論文は、航空機(UAV)が自然言語の指示を理解し、3次元環境を自律的にナビゲートする「航空視覚言語ナビゲーション」の分野を概観し、大規模言語モデル(LLM)と視覚言語モデル(VLM)の統合に焦点を当てて、方法論の分類、評価インフラの批判的検討、および7つの未解決問題を提示するサーベイである。
原題: Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models / Xingyu Xia, Lekai Zhou, Yujie Tang 他
日本語で読む → - 論文ナビゲーションロボティクス
MRReP: モバイルロボットナビゲーションのためのMRベース手描き参照経路編集インターフェース
MR環境でユーザーが手のジェスチャーで床に直接経路を描き、その経路をロボットのナビゲーションに反映させるインターフェースを提案し、従来の2Dインターフェースと比較して精度・操作性・負担の改善を実証した。
原題: MRReP: Mixed Reality-based Hand-drawn Reference Path Editing Interface for Mobile Robot Navigation / Takumi Taki, Masato Kobayashi, Yuki Uranishi
日本語で読む → - 論文視覚ナビゲーション画像認識
STRNet: 動的グラフ集約による時空間表現を用いた視覚ナビゲーション
視覚ナビゲーションのための時空間表現フレームワークを提案し、画像シーケンスと目標画像の特徴を融合して、空間グラフ推論と時間的ダイナミクスモデリングによりナビゲーション性能を向上させた。
原題: STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation / Hao Ren, Zetong Bi, Yiming Zeng 他
日本語で読む → - 論文ナビゲーションロボティクス
ポリトープ環境における長期的ジオメトリ認識ナビゲーション:MILP-MPCとミンコフスキーCBFによる階層的枠組み
複雑な非凸環境での自律ナビゲーションのため、長期的な経路計画と幾何学的安全性を両立する階層的枠組みを提案。高層でMILP-MPCにより点質量モデルで軌道生成し、低層でミンコフスキー差空間に基づくCBFでロボット形状の安全を保証する。
原題: Long-Horizon Geometry-Aware Navigation among Polytopes via MILP-MPC and Minkowski-Based CBFs / Yi-Hsuan Chen, Salman Ghori, Ania Adil 他
日本語で読む → - 論文VLA/記憶/ナビゲーションロボティクス
EmbodiedLGR: ロボットエージェントのための軽量グラフ表現と検索を統合した意味空間メモリ
ロボットが環境の記憶を効率的に構築・検索できるよう、視覚言語モデルを用いて物体の位置情報をグラフに、シーンの高レベル記述を検索アーキテクチャに格納するハイブリッド手法を提案した。NaVQAデータセットで最先端の推論・問い合わせ時間を達成した。
原題: EmbodiedLGR: Integrating Lightweight Graph Representation and Retrieval for Semantic-Spatial Memory in Robotic Agents / Paolo Riva, Leonardo Gargani, Matteo Frosi 他
日本語で読む → - 論文ナビゲーションロボティクス
NaviFormer: ナビゲーション問題を全体的に解決するTransformer型深層強化学習モデル
経路計画を高レベル(経由点の順序)と低レベル(衝突回避の軌道)に分けず、Transformerベースの深層強化学習で同時に解くモデルを提案した。実験で精度と計算速度の優位性を示した。
原題: NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem / Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco 他
日本語で読む → - 論文ナビゲーションロボティクス
OVAL: 生涯物体ゴールナビゲーションのためのオープンボキャブラリ拡張メモリモデル
生涯にわたって複数の物体を連続的に探索する物体ゴールナビゲーションの課題に対し、オープンボキャブラリのメモリフレームワークと確率ベースの探索戦略を提案し、長期的なナビゲーション効率を向上させた。
原題: OVAL: Open-Vocabulary Augmented Memory Model for Lifelong Object Goal Navigation / Jiahua Pei, Yi Liu, Guoping Pan 他
日本語で読む → - 論文ナビゲーションロボティクス
一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーション
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
原題: Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance / Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu 他
日本語で読む → - 論文ナビゲーションロボティクス
AnyImageNav: 任意視点の幾何学による精密な最終メートル画像ゴールナビゲーション
画像ゴールナビゲーションを精密な位置決めが可能な設定に拡張し、ゴール画像を幾何学的クエリとして扱い、密な画素対応による6自由度カメラ姿勢推定を実現する訓練不要のシステムを提案した。
原題: AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation / Yijie Deng, Shuaihang Yuan, Yi Fang
日本語で読む → - 論文ナビゲーションロボティクス
実世界学習に向けた漸進的残差強化学習による社会的ナビゲーション
エッジデバイス上で軽量に動作する漸進的残差強化学習(IRRL)を提案し、シミュレーションと実世界実験で未知環境への適応を実証した。
原題: Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation / Haruto Nagahisa, Kohei Matsumoto, Yuki Tomita 他
日本語で読む → - 論文ナビゲーションロボティクス
HTNav: 都市空中視覚言語ナビゲーションのための階層構造を持つハイブリッドナビゲーションフレームワーク
都市環境での空中VLNタスクに対し、模倣学習と強化学習を組み合わせたハイブリッドフレームワークを提案し、段階的訓練と階層的意思決定によりナビゲーション精度とロバスト性を向上させた。
原題: HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation / Chengjie Fan, Cong Pan, Zijian Liu 他
日本語で読む → - 論文ナビゲーションロボティクス
VLN-NF: 偽の前提指示を用いた実現可能性を考慮した視覚言語ナビゲーション
偽の前提(目標が存在しない)を含む指示でエージェントが探索し「見つからない」と明示する新しいベンチマークと手法を提案した。
原題: VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions / Hung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh 他
日本語で読む → - 論文ナビゲーションロボティクス
信頼性ガイド深度融合によるグレア耐性ナビゲーションコストマップ
反射床やガラス面のグレアによる深度センサの誤計測を、信頼性マップで推定し、その情報で占有グリッド更新を調整することで、偽障害物の蓄積を抑えるコストマップ構築手法を提案した。
原題: Reliability-Guided Depth Fusion for Glare-Resilient Navigation Costmaps / Shang-En Tsai, Wei-Cheng Sun
日本語で読む → - 論文ナビゲーションロボティクス
マルチモーダル身体性認識ナビゲーショントランスフォーマー
複数のプラットフォームと環境からのデータを用いて、RGB画像、3D LiDAR点群、目標埋め込み、ロボットの身体性記述子を融合するトランスフォーマーベースのナビゲーションポリシーを提案し、拡散モデルによる軌道生成と衝突予測ヘッドによりロバスト性を向上させた。
原題: Multimodal embodiment-aware navigation transformer / Louis Dezons, Quentin Picard, Rémi Marsal 他
日本語で読む → - 論文ナビゲーションロボティクス
迷走を止める:メタ認知推論による効率的な視覚言語ナビゲーション
基礎モデルを用いた訓練不要の視覚言語ナビゲーションエージェントに、空間記憶・履歴認識計画・反射的修正を統合したメタ認知機構を導入し、探索の停滞や冗長な再訪問を減らして効率と性能を向上させた。
原題: Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning / Xueying Li, Feng Lyu, Hao Wu 他
日本語で読む → - 論文ナビゲーションロボティクス
考える前に進む:画像目標ナビゲーションのための階層的推論
画像目標ナビゲーションを高レベル計画と低レベル実行に分解し、視覚言語モデルで短期的計画を生成して強化学習ポリシーを導く階層的フレームワークHRNavを提案。迷いを減らすペナルティも導入し、シミュレーションと実環境で有効性を実証した。
原題: Think before Go: Hierarchical Reasoning for Image-goal Navigation / Pengna Li, Kangyi Wu, Shaoqing Xu 他
日本語で読む → - 論文ナビゲーションロボティクス
失敗認識を備えた模倣学習による安全なロボットナビゲーション
成功デモのみに頼る模倣学習の限界を指摘し、失敗データを価値推定に活用して政策学習は成功デモに限定する枠組みを提案。衝突率を減らしつつ成功率を維持することを実証した。
原題: Learning from Demonstration with Failure Awareness for Safe Robot Navigation / Xianghui Wang, Siwei Cheng, Shanze Wang 他
日本語で読む → - 論文ナビゲーションロボティクス
AURA: 実世界の都市ナビゲーションのためのマルチモーダル共有自律
都市環境での長期的なナビゲーションを、人間の高レベル指示とAIの低レベル制御に分解する共有自律フレームワークAURAを提案。大規模データセットと実世界実験で、人間の操作負担を減らしつつナビゲーション安定性を向上させることを示した。
原題: AURA: Multimodal Shared Autonomy for Real-World Urban Navigation / Yukai Ma, Honglin He, Selina Song 他
日本語で読む →