日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ビデオ理解arXiv:2608.15539

CrossView: 視覚言語モデルはカメラをまたいで推論できるか?

CrossView: Can Vision-Language Models Reason Across Cameras?

シェア:XThreadsFacebookLINEはてブBluesky

複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。

詳しい要約

1. どんなもの?

CrossViewは、複数カメラ映像に対する質問応答を評価する新しいベンチマークである。自動運転、セキュリティ監視、自我中心/他者中心映像、ロボティクスなど、複数視点が同時に得られる現実世界のシナリオを対象とし、モデルが複数視点を横断して推論する能力を測定する。

2. 先行研究と比べてどこがすごい?

従来のビデオ理解ベンチマークは単一カメラ設定に焦点を当てており、複数カメラ特有の課題(視点数に応じた文脈スケーリング、一部のカメラからのみ見えるオクルージョン解決、重要視点の判断、重複・分岐する視点間の証拠統合)を体系的に扱っていない。CrossViewはこれらの課題を直接ターゲットにした初のベンチマークである点が新しい。

3. 技術・手法の肝は?

手法の肝は、複数カメラ映像を入力とし、視点間の関係性を考慮した推論を必要とする質問応答タスクの設計にある。具体的には、自動運転、監視、自我中心/他者中心、ロボティクスといった多様な領域のデータセットを収集し、モデルが複数視点を同時に処理できるかどうかを評価する。

4. どうやって有効だと検証した?

GPT-5.2などのプロプライエタリモデルとQwen3-VLなどのオープンソースモデルを評価し、全体的に低い精度を示した。特にオープンソースモデルは大きな差で遅れをとった。また、モデルの複数視点を共同処理する能力と性能が強く相関することを確認した。

5. 議論はある?

要旨からは、複数カメラ推論が単一カメラ問題の単純な拡張ではなく根本的に異なるという主張がなされているが、具体的な議論の詳細は不明。また、オープンソースモデルの性能差の原因や、ベンチマークの難易度の適切性などについての議論は要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されているモデルはGPT-5.2とQwen3-VLであり、これらは関連研究として挙げられる。また、ビデオ理解ベンチマーク全般に関する研究(例:VideoQAベンチマーク)や、マルチカメラ推論に関する既存研究が次に読むべき論文として考えられるが、要旨からは特定の論文名は不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

分類: cs.CV

原文アブストラクト

Video understanding benchmarks have long centered on single-camera settings, where modern multi-modal language models achieve strong performance across image and video tasks. Yet, the real world runs on multi-camera networks: autonomous vehicles, security systems, and robots all gather data across many simultaneous views. We argue that this is not simply "more" of the single-camera problem; it is fundamentally different. Multi-camera reasoning requires handling context that scales with the number of views, resolving occlusions visible from only a subset of cameras, judging which views matter, and integrating evidence across perspectives that may overlap or diverge. Current models struggle with exactly these challenges, yet no benchmark systematically targets them. We introduce CrossView, a multi-camera video question-answering benchmark spanning autonomous driving, security surveillance, egocentric/exocentric video, and robotics. Evaluation of proprietary models, such as GPT-5.2, and open-source models, like Qwen3-VL, reveals consistently low accuracy, with open-source models trailing by a wide margin. Performance scales strongly with a model's ability to jointly process multiple viewpoints, positioning CrossView as a rigorous benchmark for multi-camera video. We open-source our code and dataset at https://utaustin-swarmlab.github.io/CrossView.

関連論文