Ji Zhang
Carnegie Mellon University
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GlassGuard: ロボットナビゲーションのための検証済みガラス平面マッピングナビゲーション2026/10/1
LiDARと視覚情報を組み合わせてガラス面を検出・再構成し、通過可能空間を汚染せずにガラスを障害物として地図化するナビゲーション向けフレームワークを提案。実世界9シーンで評価し、高いガラス被覆率と低い誤検出を達成。
- Map2Route: 意味地図上の構成的言語指示に基づく経路計画ベンチマーク経路計画2026/9/15
意味地図上で複雑な言語指示から経路を計画するベンチマークMap2Routeと、コード実行と検証を組み合わせた手法Grounding2Routeを提案した。
- スーパーオドメトリ2.0:階層的適応による頑健なオドメトリオドメトリ2026/8/26
環境劣化に応じてセンサ融合を動的に適応させる頑健なオドメトリフレームワークを提案。IMUをカメラやLiDARと同等に扱い、劣化時でも信頼性を確保する。
- SuperMap: 視覚言語ナビゲーションのための時空間SLAMシステムSLAM/ナビゲーション2026/8/24
高頻度の幾何SLAMと非同期のオープンボキャブラリ知覚を統合し、物体の同一性維持と古い地図情報の整理を行う4D時空間マッピングフレームワークを提案。
- IntentNav: 人間のデモから空間視覚オブジェクトナビゲーションを学習するナビゲーション2026/6/1
人間のデモから探索意図を学習し、空間記憶と視覚的手がかりを統合してオブジェクトナビゲーションを行うフレームワークを提案。複数ベンチマークで最高性能を達成し、異なるロボットへのゼロショット転移も可能。
- Goal2Pixel: ナビゲーション目標をピクセルに接地する視覚言語ナビゲーションVLMナビゲーション2026/6/1
視覚言語ナビゲーションを、行動予測ではなく画像平面上のナビゲーション可能なピクセル接地として再定式化し、VLMの推論回数を大幅に削減しつつ高性能を達成した。
- SysNav: マルチレベル系統的協調による実世界・クロスエンボディ物体ナビゲーションの実現ナビゲーション2026/3/1
実世界の物体ナビゲーションをシステムレベルで捉え、セマンティック推論・ナビゲーション計画・運動制御を分離した3層システムSysNavを提案し、車輪型ロボット、四足、人型の3つの異なるエンボディで実証した。
- 多数派を超えて:ロボットマニピュレーションのためのロングテール模倣学習マニピュレーション2026/2/1
訓練データが一部のタスクに偏るロングテール問題に対し、データ豊富なタスクからデータ希少なタスクへ知識を転移するApproaching-Phase Augmentationを提案し、ロボット操作の性能を改善した。
- シミュレーションと人間の協調学習によるデータ効率的で汎化可能なロボットマニピュレーションマニピュレーション2026/1/1
シミュレーションのロボット動作と実世界の人間観察を同時に活用する協調学習フレームワークSimHumを提案し、少ない実データで汎化性能の高いマニピュレーションを実現した。
- RPT*: 確率的終端を持つ目標探索のための大域的計画法経路計画2026/1/1
各候補地点に目標が存在する確率を与え、訪問順序に依存する期待コストを最小化する新たな経路計画問題HPP-PTを定式化し、動的計画法と新ヒューリスティクスによる最適保証付き探索手法RPT*を提案した。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- 効率的な視覚-言語-行動モデルのサーベイVLA2025/10/1
視覚-言語-行動モデル(VLA)の効率化に関する初の包括的サーベイであり、モデル設計・学習・データ収集の3つの柱で既存研究を整理し、課題と今後の方向性を示す。
- LLM-RG: 大規模言語モデルを用いた屋外シーンにおける参照表現のグラウンディングVLA2025/9/1
屋外運転シーンで自然言語の参照表現(例:「右側の黒い車」)が指す物体を特定するため、視覚言語モデルで属性を抽出し、大規模言語モデルで推論するハイブリッド手法を提案。Talk2Carベンチマークで大幅な精度向上を達成。
- ロボット基盤モデルのためのポリシー対比デコーディングVLA2025/5/1
ロボット基盤モデルが学習する偽の相関を、物体マスク画像との行動確率分布の対比により訓練なしで補正し、汎化性能を向上させる手法を提案。
- STRIVE: VLM推論を統合した構造的表現による効率的物体ナビゲーション物体ナビゲーション2025/5/1
VLMを物体ナビゲーションに活用するため、環境を視点・物体・部屋の階層で表現し、VLM推論による高レベル計画と低レベル探索を組み合わせる二段階方策を提案。シミュレーションと実機で成功率と効率を向上させた。
- InSpire: 内在的空間推論を備えた視覚-言語-行動モデルVLA2025/5/1
VLAモデルに「物体はロボットから見てどの方向か」という空間推論を組み込むことで、タスク無関係な視覚特徴への誤相関を抑え、汎化性能を高める手法を提案。
- SORT3D: 大規模言語モデルを用いたゼロショット3Dグラウンディングのための空間オブジェクト中心推論ツールボックス3Dグラウンディング2025/4/1
2Dの物体属性とヒューリスティックな空間推論ツールボックスをLLMの逐次推論能力と組み合わせ、テキスト-3Dデータなしで未知環境にゼロショット適用できる3Dグラウンディング手法を提案。
- IRef-VLA: 不完全な言語指示を用いた3Dシーンにおける対話的参照グラウンディングのベンチマークVLA2025/3/1
不完全・曖昧な自然言語指示で3D屋内をナビゲートするタスク向けに、11.5Kの3Dスキャン部屋と470万件の参照文を含む大規模ベンチマークデータセットを構築し、既存モデルの性能評価基盤を提供した。
- VLA-3D: 3D意味理解とナビゲーションのための大規模データセットナビゲーション2024/11/1
屋内3Dシーンにおける言語指示ナビゲーション向けに、11.5K以上のスキャン済み部屋、2350万の物体間意味関係、970万の参照文を含む最大規模の実世界データセットを構築し、最先端モデルのベースライン性能を評価した。
- 可動障害物を含む対話的環境における探索ベース経路計画経路計画2024/10/1
ロボットが経路上の可動物体を押しのけて進むPAMO問題に対し、巨大な状態空間のごく一部のみを探索するPAMO*を提案し、最大400物体の混雑環境で1秒以内に最適解を得られることを示した。
- Visual SLAMとセマンティックセグメンテーションを用いた高速な平均放射温度マッピングフレームワークSLAM/セマンティックセグメンテーション2024/10/1
Visual SLAMとGrounded SAMによるセマンティックセグメンテーションを組み合わせ、表面温度情報を付加した3Dサーモ点群から室内の平均放射温度分布を高速に推定・マッピングするフレームワークを提案した。
- Air-FAR: 大規模複雑未知環境における航空ナビゲーションのための高速で適応的な経路計画経路計画2024/9/1
階層的3D可視性グラフを用いて、大規模で複雑な未知環境をリアルタイムに飛行する経路計画手法を提案し、従来手法より大幅に高速かつ効率的な経路生成を実現した。
- Interactive-FAR: 複雑未知環境における可動障害物を考慮した対話的・高速・適応的経路計画ナビゲーション2024/4/1
未知環境で可動障害物を押しのけながらナビゲーションするリアルタイム経路計画アルゴリズムを提案し、従来手法より33%の移動時間短縮と49%の経路効率向上を実現した。
- SubT-MRS Dataset: Pushing SLAM Towards All-weather Environments2023/7/1
- Active Velocity Estimation using Light Curtains via Self-Supervised Multi-Armed Bandits2023/2/1
- MUI-TARE: Multi-Agent Cooperative Exploration with Unknown Initial Position2022/9/1
- iSimLoc: Visual Global Localization for Previously Unseen Environments with Simulated Images2022/9/1
- AutoMerge: A Framework for Map Assembling and Smoothing in City-scale Environments2022/7/1
- RCA: Ride Comfort-Aware Visual Navigation via Self-Supervised Learning2022/7/1
- ALTO: A Large-Scale Dataset for UAV Visual Place Recognition and Localization2022/7/1
- ALITA: A Large-scale Incremental Dataset for Long-term Autonomy2022/5/1
- Autonomous Exploration Development Environment and the Planning Algorithms2021/10/1
- FAR Planner: Fast, Attemptable Route Planner using Dynamic Visibility Update2021/10/1
- i3dLoc: Image-to-range Cross-domain Localization Robust to Inconsistent Environmental Conditions2021/5/1
- Following Social Groups: Socially Compliant Autonomous Navigation in Dense Crowds2019/11/1