日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.15517

GLaQ: 視覚的証拠への潜在クエリ接地によるマルチモーダル推論

GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning

シェア:XThreadsFacebookLINEはてブBluesky

マルチモーダル大規模言語モデルの推論において、連続的な潜在状態の代わりに、元の視覚トークンに接地された固定数のクエリを用いることで、細かい視覚情報を効果的に保持・再利用する手法を提案した。

詳しい要約

1. どんなもの?

GLaQは、マルチモーダル大規模言語モデル(MLLM)の推論能力を向上させるためのフレームワークである。従来の連鎖的思考(Chain-of-thought)推論では、テキストベースの推論ステップ間で細かい視覚的証拠を保持・再利用することが難しい。GLaQは、外部ツールや追加の推論時処理を必要とせず、視覚トークンに基づく固定セットのコンテキスト条件付きクエリを導入し、これらを元の視覚トークンに接地することで、直接かつ協調的に視覚的証拠にアクセスする。クエリは回答生成時に再注入され、ソースの視覚的証拠への直接的なアクセスを提供する。

2. 先行研究と比べてどこがすごい?

先行研究の手法は、外部ツールを用いて画像を再訪・操作するtool-augmented thinking-with-images法と、連続的な視覚潜在推論を行う内部的手法に大別される。前者は事前定義されたツールと追加の推論時処理を必要とし、後者は自己回帰的な構成により、後の潜在状態が先行状態に依存し、情報の重複が生じる可能性がある。GLaQは、自己回帰的な潜在ロールアウトを排除し、固定クエリを視覚トークンに接地することで、これらの問題を解決し、外部操作なしで局所的な視覚証拠を回復できる点が優れている。

3. 技術・手法の肝は?

GLaQの技術的な核心は、連続的な潜在ロールアウトを、元の視覚トークンに接地された固定セットのコンテキスト条件付きクエリに置き換えることである。具体的には、クエリは入力コンテキスト(テキストと画像)に基づいて生成され、視覚トークンとの接地を通じて関連する視覚情報を抽出する。その後、これらの接地クエリは回答生成時に再注入され、視覚的証拠への直接的なアクセスを提供する。訓練は、局所的な視点の教師信号を用いた後、タスクレベルの報酬に基づく強化学習によって行われる。

4. どうやって有効だと検証した?

GLaQは、細かい視覚的理解と知覚に関する5つのベンチマークで評価された。GLaQ-7Bは、ベースモデルに対して5.99%から9.66%の改善を達成し、比較されたすべての視覚潜在手法を上回った。これにより、直接的なクエリと画像の接地が、外部の視覚操作や自己回帰的な潜在ロールアウトなしで、局所的な証拠を回復できることが示された。

5. 議論はある?

要旨からは、GLaQの限界や潜在的な欠点についての議論は明示されていない。しかし、固定クエリの数や設計がタスクに依存する可能性や、強化学習の報酬設計の複雑さなどが考えられるが、これらは要旨の範囲外である。また、GLaQは7Bモデルでの評価のみであり、より大規模なモデルでの有効性は不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、tool-augmented thinking-with-images法や連続的な視覚潜在推論の手法が挙げられる。具体的には、外部ツールを用いた手法(例: 画像を再訪・操作する手法)や、自己回帰的な潜在推論を行う手法(例: 連続的な潜在状態を保持する手法)が関連する。次に読むべき論文としては、これらの手法を詳述した論文や、マルチモーダル推論における視覚的接地の研究が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zesheng Yang, Lingling Zhang, Xinyu Zhang, Cheng Zhang, Pengyu Li, Heng Wang, Lin Wu

分類: cs.CV

原文アブストラクト

Chain-of-thought reasoning has substantially improved the problem-solving capabilities of multimodal large language models. Fine-grained visual evidence, however, remains difficult to preserve and reuse across text-based reasoning steps. To address this limitation, tool-augmented thinking-with-images methods maintain visual access externally by revisiting or manipulating the image, but require predefined tools and additional inference-time processing. As an internal alternative, continuous visual latent reasoning retains intermediate computation in hidden states. However, its prevailing autoregressive construction makes each latent state depend on its predecessors, so later states may repeat information already present in the latent sequence rather than capture complementary visual details. We introduce GLaQ, a grounded latent-query framework that replaces sequential latent rollout with a fixed set of context-conditioned queries grounded in the original visual tokens. The grounded queries are reinjected for answer generation, providing direct and coordinated access to source visual evidence. We train GLaQ with localized-view supervision followed by reinforcement learning under task-level rewards. Across five benchmarks for fine-grained visual understanding and perception, GLaQ-7B gains 5.99--9.66\% over its base model and leads all compared visual latent methods, suggesting that direct query-to-image grounding can recover localized evidence from the full image without external visual operations or autoregressive latent rollouts.

関連論文