日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
視覚障害者支援/身体性AIarXiv:2609.21828

Touvigation:未知の屋内環境における視覚障害者のための身体適応型物体取得支援

Touvigation: Embodied Adaptive Object Acquisition for Blind and Low-Vision Users in Unfamiliar Indoor Environments

シェア:XThreadsFacebookLINEはてブBluesky

視覚障害者が未知の屋内で物を探して手に取るのを支援するハンズフリーシステムを提案し、視覚言語理解と持続的な局所空間モデルを組み合わせて身体相対の低遅延ガイダンスを実現、12名の参加者実験で成功率100%を達成した。

詳しい要約

1. どんなもの?

- 視覚障害・低視力(blind and low-vision)ユーザーが未知の屋内環境で物体を発見・取得するのを支援するハンズフリーシステム「Touvigation」を提案。 - vision-language understandingとpersistent local spatial modelingを組み合わせ、低遅延で身体相対的なガイダンスを提供。 - 8名のblind and low-vision参加者へのformative interviewsに基づき、orienting→walking→reaching→tactile verificationの段階に応じて空間参照を適応させるmulti-stage guidance frameworkを設計。 - 12名のblind and low-vision参加者を対象に、multimodal large-language-model assistantおよびunassisted searchと比較評価。

2. 先行研究と比べてどこがすごい?

- 既存のvision-language-model-based assistantsは意味記述を提供できるが、latency、hallucinations、embodied actionとの整合性の低さが課題。 - Touvigationはpersistent local spatial modelingにより、低遅延で身体相対的なガイダンスを実現。 - 評価ではTouvigationが100%のタスク成功率を達成し、multimodal assistant(58%)やunassisted search(85%)を上回り、完了時間とcognitive workloadも削減。

3. 技術・手法の肝は?

- vision-language understandingとpersistent local spatial modelingを統合。 - 8名のblind and low-vision参加者へのformative interviewsに基づき、multi-stage guidance frameworkを設計。 - ユーザーの状態(orienting, walking, reaching, tactile verification)に応じて空間参照を適応。 - ハンズフリーで動作し、低遅延のbody-relative guidanceを提供。

4. どうやって有効だと検証した?

- 12名のblind and low-vision参加者を対象に、Touvigationをmultimodal large-language-model assistantおよびunassisted searchと比較する評価を実施。 - タスク成功率:Touvigation 100%、multimodal assistant 58%、unassisted search 85%。 - 完了時間とcognitive workloadの削減も確認。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:vision-language-model-based assistants、multimodal large-language-model assistant。 - 関連手法:persistent local spatial modeling、embodied guidance。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: George Xi Wang, Xiangyu Li, Shaoyue Wen, Jiaqian Hu, Junan Xie, Yupeng Wang, Ziyue Shi, Qijun Chen, Maaike Bouwmeester, Yuhua Jin, Jing Qian

分類: cs.HC, cs.AI

原文アブストラクト

Blind and low-vision users often face challenges when locating and physically acquiring objects in unfamiliar indoor environments. Existing vision-language-model-based assistants can provide semantic descriptions but may introduce latency, hallucinations, and guidance that is poorly aligned with embodied action. We present Touvigation, a hands-free object acquisition system that combines vision-language understanding with persistent local spatial modeling to provide low-latency, body-relative guidance. Drawing on formative interviews with eight blind and low-vision participants, we design a multi-stage guidance framework that adapts spatial references as users transition from orienting, to walking, to reaching and tactile verification. We evaluated Touvigation with 12 blind and low-vision participants against a multimodal large-language-model assistant and unassisted search. Touvigation achieved 100% task success, compared with 58% for the multimodal assistant and 85% for unassisted search, while reducing completion time and cognitive workload. Our findings demonstrate how persistent spatial grounding and adaptive embodied guidance can improve object acquisition for blind and low-vision users.

PR本紙発行元 EmplifAI