日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:2608.12515

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

シェア:XThreadsFacebookLINEはてブBluesky

詳しい要約

1. どんなもの?

本論文は、ロボットの自己中心視(egocentric)画像から近接リスク(proxemic risk)を評価するために、3つのオープンソースのVision-Language Models(VLMs)—InternVL、Qwen-VL、SmolVLM—を用いて、画像を4つの危険レベルに分類するタスクを検証した研究である。プロンプト戦略3種とQLoRAによるファインチューニング(2ラウンド)を比較し、層化ランダムベースラインと対比している。

2. 先行研究と比べてどこがすごい?

先行研究では、VLMの一般的な視覚言語タスクや、ロボットナビゲーションにおける物体認識などが扱われてきたが、近接リスクのような細粒度の空間的推論を必要とするタスクへの適用は十分に検討されていなかった。本研究は、複数のVLMを体系的に比較し、プロンプト戦略とファインチューニングの効果を評価することで、VLMの近接リスク推論能力の限界を明らかにした点が新しい。

3. 技術・手法の肝は?

手法の肝は、3つのVLM(InternVL、Qwen-VL、SmolVLM)に対して、3種類のプロンプト戦略(基本、詳細、高度)を適用し、さらにQLoRAによるファインチューニングを2ラウンド行った点である。また、人物の位置特定(person localization)の分析を行い、危険分類の正しさと空間的接地(spatial grounding)の対応関係を調べた。

4. どうやって有効だと検証した?

有効性の検証は、自己中心視のロボット画像データセットを用いて、4つの危険レベル分類の精度を層化ランダムベースラインと比較することで行った。ファインチューニングなしでは全モデルがベースラインに近い性能だったが、ファインチューニングにより全体的にわずかな改善が見られた。特に、Qwen-VLは高度なプロンプトで高危険ケースの再現率が他モデルより大幅に高かった。

5. 議論はある?

議論として、正しい危険分類が必ずしも人物の位置特定の正確さに対応しないことが示され、モデルが関連領域に注意を向けずに安全ラベルを生成する可能性が指摘された。また、現在のVLMは細粒度の近接推論と空間的接地に限界があるが、対象を絞ったプロンプトとファインチューニングにより、選択されたモデルで高危険検出が改善できることが示された。

6. 次に読むべき論文は?

要旨からは、次に読むべき具体的な論文は不明であるが、関連する分野として、VLMの空間的推論能力の評価、ロボットナビゲーションにおける安全性、プロンプトエンジニアリング、QLoRAなどのパラメータ効率的ファインチューニング手法に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Vladyslava Rudas, Dmytro Kuzmenko

分類: cs.CV, cs.RO

原文アブストラクト

Assessing proxemic danger from a robot's egocentric perspective is critical for safe embodied navigation in human environments and requires both visual and contextual reasoning. We evaluate three opensource vision-language models (VLMs) (\textit{InternVL}, \textit{Qwen-VL}, and \textit{SmolVLM}) on the classification of egocentric robot images into four danger levels, comparing three prompting strategies and two rounds of QLoRA fine-tuning against a stratified random baseline. Without fine-tuning, all models perform near the baseline, while fine-tuning yields only modest overall improvements. However, \textit{Qwen-VL} with an advanced prompt achieves substantially higher recall for high-danger cases than the other models. An analysis of person localization further shows that correct danger classification does not correspond to better spatial grounding, indicating that a model may produce a useful safety label without attending to the relevant region of the scene. These results show that current VLMs remain limited in fine-grained proxemic reasoning and spatial grounding, although targeted prompting and fine-tuning can improve high-danger detection in selected models.