日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/ベンチマークarXiv:2608.15425

NumerosityVLM: 視覚言語モデルにおける数量表現の解釈のための認知に着想を得たベンチマーク

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語モデルの数量知覚能力を評価するため、物体の大きさや配置などの視覚的要因を独立に操作した合成画像ベンチマークを構築し、モデル性能の要因分析と層別プロービングを行った。

詳しい要約

1. どんなもの?

NumerosityVLMは、Vision-Language Models (VLMs)の数知覚(numerosity perception)能力を評価するために設計された、認知科学に着想を得た診断用ベンチマークである。10,800枚の合成画像から構成され、6つの制御条件下で、オブジェクトのサイズ、空間配置、数(numerosity)を直交的に操作し、さらにテクスチャ、形状、色を段階的に除去する。これにより、既存のcountingベンチマークが数と相関する視覚的要因を絡めていた問題を解消し、VLMsの数表現の本質を調べることを目的とする。

2. 先行研究と比べてどこがすごい?

既存のcountingベンチマークは、数(numerosity)と相関する視覚的要因(例:オブジェクトのサイズや配置)を分離しておらず、モデルが数を正確に認識しているのか、それとも他の視覚的手がかりに依存しているのかを区別できなかった。NumerosityVLMは、これらの要因を直交的に操作し、さらにテクスチャ、形状、色を段階的に除去することで、純粋なnumerosity表現を評価できる点が優れている。また、層ごとのプロービングにより、視覚エンコーダの初期段階で線形分離可能なnumerosity信号が出現することを示し、モデル内部の表現を分析する点も新しい。

3. 技術・手法の肝は?

手法の肝は、ベンチマークの設計と分析にある。具体的には、(1) 合成画像を用いて、オブジェクトのサイズ、空間配置、numerosityを独立に操作し、さらにテクスチャ、形状、色を段階的に除去する6つの制御条件を設定。(2) 7つのVLMをzero-shot設定で評価し、多因子分析(multi-factor analysis)を用いて、モデルアーキテクチャが性能分散の最大の割合(部分ω²=0.325)を説明することを示す。(3) 層ごとのプロービング(layer-wise probing)により、視覚エンコーダの初期層で線形分離可能なnumerosity信号が一貫して出現することを発見。

4. どうやって有効だと検証した?

有効性の検証は、7つのVLMをzero-shot設定でNumerosityVLM上で評価し、多因子分析によりモデルアーキテクチャが性能分散の最大の割合を説明することを示した。さらに、層ごとのプロービングにより、視覚エンコーダの初期段階で線形分離可能なnumerosity信号が出現することを確認し、モデル間の性能差が主に言語モデルコンポーネントに関連することを明らかにした。

5. 議論はある?

要旨からは、議論の詳細は不明であるが、モデルアーキテクチャが性能に最も大きな影響を与えること、視覚エンコーダの初期層でnumerosity信号が出現する一方で、言語モデルコンポーネントが性能差に関連するという発見は、VLMsの数知覚メカニズムに関する新たな洞察を提供する。また、合成画像のみを用いているため、実世界の複雑なシーンへの一般化については議論の余地があると考えられる。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連する分野として、人間の数知覚の認知モデル、VLMsの評価ベンチマーク(例:object countingベンチマーク)、およびモデルの内部表現の解釈可能性に関する研究が挙げられる。具体的には、既存のcountingベンチマークや、VLMの視覚エンコーダのプロービングに関する論文を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

分類: cs.CV, cs.AI

原文アブストラクト

Vision-language models (VLMs) achieve strong performance on high-level multimodal tasks, yet numerosity perception, a cognitive ability that emerges in human infants before language acquisition, remains poorly understood in current models, as existing counting benchmarks entangle numerosity with correlated visual factors. We introduce a cognitively inspired diagnostic benchmark, NumerosityVLM, comprising 10,800 synthetic images across six controlled conditions. The benchmark orthogonally manipulates object size, spatial arrangement, and numerosity, while progressively ablating texture, shape, and color. Evaluating seven VLMs in a zero-shot setting, multi-factor analysis reveals that model architecture explains the largest proportion of performance variance (partial $ω^{2}=0.325$), far exceeding visual conditions. Layer-wise probing further shows that linearly separable numerosity signals consistently emerge at early stages of the vision encoder, while performance differences across evaluated models are primarily associated with the language model component. Code and data are publicly available at https://github.com/fuy3/NumerosityVLM-Benchmark, and https://huggingface.co/datasets/fuy3/NumerosityVLM.

関連論文