日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
画像分類arXiv:2608.13463v1

MLLMルーティングによる異種アンサンブルを用いた頑健なクロスデータセット画像分類

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

シェア:XThreadsFacebookLINEはてブBluesky

マルチモーダル大規模言語モデル(MLLM)エージェントが各画像を最適な視覚バックボーンに動的ルーティングするアンサンブル手法ARMDILを提案し、複数データセットにまたがる画像分類の頑健性と適応性を向上させた。

詳しい要約

1. どんなもの?

ARMDILは、マルチモーダル大規模言語モデル(MLLM)エージェントを用いて、各画像を最適な視覚バックボーンに動的にルーティングするアンサンブル手法。複数の画像データセットから構築した統一ラベル空間で訓練された、CNN(ResNets)、自己教師あり表現学習器(SSL)、視覚言語モデル(VLM)からなる多様なアンサンブルを活用し、クロスデータセット画像分類のロバスト性を向上させる。

2. 先行研究と比べてどこがすごい?

従来の画像分類モデルは単一タスク特化データセットで訓練され、ドメインや難易度の異なるデータへの一般化が困難。ARMDILは、訓練ベースのルーターと同等の性能を達成しつつ、プロンプト変更による新情報の統合や、自然言語推論トレースによる解釈可能性の向上を実現。

3. 技術・手法の肝は?

MLLMエージェントが各画像を解析し、複数の視覚バックボーン(ResNet、SSL、VLM)の中から最適なものを選択するルーティングを行う。各バックボーンは統一ラベル空間で訓練され、多様なドメインの特徴を捉える。ルーティングはプロンプトで制御可能で、解釈可能性のための推論トレースを生成。

4. どうやって有効だと検証した?

複数の異なる分布と特性を持つ画像データセットを用いた経験的評価により、各アーキテクチャの能力と脆弱性を明らかにし、ARMDILがそれらのトレードオフを効果的にナビゲートすることを示した。訓練ベースのルーターと競合する性能を達成。

5. 議論はある?

要旨からは、ARMDILのルーティング決定の正確性や、MLLMエージェントの計算コスト、スケーラビリティ、特定のドメインでの失敗事例などについての詳細な議論は不明。また、統一ラベル空間の構築方法や、各バックボーンの選択基準の詳細も要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、マルチモーダル大規模言語モデル(MLLM)、自己教師あり表現学習(SSL)、視覚言語モデル(VLM)、およびアンサンブル学習やルーティングに関する研究が挙げられる。具体的には、ResNet、CLIPなどのVLM、SimCLRなどのSSL手法、およびMixture of Experts(MoE)やルーティングネットワークに関する論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

分類: cs.CV, cs.AI, cs.CL, cs.LG

原文アブストラクト

Modern image classification models excel when trained on single task-specific datasets but often struggle to generalize across domains and difficulty levels. We propose ARMDIL, an Adaptive Router for Multi-Domain Image classification with LLMs. ARMDIL is an ensemble that uses a multimodal large language model (MLLM) agent to dynamically route each image to the most suitable vision backbone. Our diverse ensemble employs convolutional neural networks (ResNets), self-supervised representation learners (SSL), and vision-language models (VLMs), each trained on a unified label space constructed from multiple image datasets with differing distributions and characteristics. Empirical evaluations illuminate the distinct capabilities and vulnerabilities of each architecture across disparate visual domains. Crucially, we show that ARMDIL effectively navigates these trade-offs, performing competitively with specialized training-based routers. Furthermore, it drastically improves adaptability by allowing new information to be integrated via simple prompt modifications, while enhancing interpretability through natural language reasoning traces. These advances in cross-dataset image classification pave the way for more reliable general-purpose vision systems such as AI assistants and autonomous robots.