日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VQA/空間認識arXiv:2608.05747

GST-Bench: ビデオからVLMsはグローバルな空間認識を獲得できるか?

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

シェア:XThreadsFacebookLINEはてブBluesky

連続的な長期間ビデオからグローバルな空間認識を評価する新しいベンチマークGST-Benchを提案し、22の最先端VLMを評価した結果、人間との大きなギャップを明らかにした。

詳しい要約

1. どんなもの?

GST-Benchは、ビデオ理解におけるグローバルな空間知能を評価するためのVQAベンチマークである。6,790分の合成生成ビデオから導出された人間検証済みの質問で構成され、モデルが入力ビデオ内で見られない新しい視点からの正確な空間推論を行い、自我中心の観察をグローバルなトップダウン画像にマッピングすることを要求する。

2. 先行研究と比べてどこがすごい?

既存のベンチマークは単一または少数の視点からの局所的な空間知覚に焦点を当てており、連続的で長期的な視覚ストリームにわたるグローバルな空間認識を無視している。GST-Benchは、このギャップに対処するために、長期的なビデオ入力からグローバルな空間推論を評価する最初のベンチマークである。

3. 技術・手法の肝は?

GST-Benchは、合成生成されたビデオを使用して、モデルが新しい視点からの空間推論とグローバルなトップダウン表現へのマッピングを行う質問を生成する。さらに、モデルの失敗原因を分析するためにGST-Bench-Localを構築し、トレーニング用のGST-Trainデータセットも提供する。

4. どうやって有効だと検証した?

22の最先端のVLMを評価し、最強のゼロショットモデルでも42.68のスコアしか達成できず、人間の79.08を大きく下回ることを示した。また、GST-Bench-Localを用いて、モデルが局所的な空間理解は強いが、長期的な観察をグローバルに一貫したシーン表現に統合できないことを明らかにした。

5. 議論はある?

モデルと人間の間の大きなギャップは、現在のVLMが長期的なビデオからグローバルな空間認識を発展させる能力に重大な限界があることを示している。局所的な空間理解が強いにもかかわらず、グローバルな統合が失敗する原因は、モデルの記憶や表現の統合メカニズムにある可能性が示唆される。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、空間認識を扱うベンチマーク(例:VQAベンチマーク)や、ビデオ理解のためのモデル(例:Video Language Models)に関する論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

分類: cs.CV

原文アブストラクト

Spatial intelligence is fundamental to embodied agents, yet existing benchmarks focus on local spatial perception from single or few viewpoints, overlooking global spatial awareness over continuous, long-horizon visual streams. To address this limitation, we introduce the Global-Spatial-Temporal Benchmark (GST-Bench), a VQA benchmark for global spatial intelligence in video understanding, comprising human-verified questions derived from 6,790 minutes of synthetically generated video. It requires models to perform accurate spatial inference from novel viewpoints unseen in the input video and to map egocentric observations onto global top-down images. A comprehensive evaluation of 22 state-of-the-art VLMs exposes a striking gap between models and humans: the strongest zero-shot model attains only 42.68, far below the human score of 79.08. To probe the cause of this gap, we construct GST-Bench-Local and find that models, despite strong local spatial understanding under the same task formulation, still fail to consolidate long-horizon observations into a globally consistent scene representation. We further provide GST-Train, a dataset for global spatial reasoning, as a complementary resource to facilitate future research on this challenge.