Jingyi Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
セグメンテーション/知識蒸留視覚言語ナビゲーションナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MobileSAM2: 空間知能のための軽量セグメント・エニシングセグメンテーション/知識蒸留2026/7/14
SAM2をモバイル端末で動作するよう軽量化したモデルを提案。ハイパーグラフを用いた知識蒸留法HyperKDを導入し、画像・動画のセグメンテーション性能を保ちつつ効率化を実現した。
- Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション視覚言語ナビゲーション2026/3/1
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
- AI盲導犬:スマートフォン上の一人称視点経路予測ナビゲーション2025/1/1
視覚障害者向けに、スマートフォンでリアルタイム動作する一人称視点の軽量ナビゲーションシステムを提案し、屋内・屋外の目的地あり・なし両方の移動を支援する。
- RoomTour3D: 幾何情報を活用した動画指示チューニングによる身体性ナビゲーションナビゲーション2024/12/1
Web上のルームツアー動画から3D再構成を行い、歩行軌跡と指示文を付与した大規模データセットRoomTour3Dを構築し、VLNタスクの性能を大幅に改善した。