Kamila Zhumakhanova
収録論文 2本 ・ フィジカルAI/ロボット学習
視覚言語ナビゲーションナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション視覚言語ナビゲーション2026/3/1
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
- RoomTour3D: 幾何情報を活用した動画指示チューニングによる身体性ナビゲーションナビゲーション2024/12/1
Web上のルームツアー動画から3D再構成を行い、歩行軌跡と指示文を付与した大規模データセットRoomTour3Dを構築し、VLNタスクの性能を大幅に改善した。