日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.21878

ViSMoE: 身体化された指示表現グラウンディングのための視覚認識スパース混合エキスパート

ViSMoE: Visual-Aware Sparse Mixture-of-Experts for Embodied Referring Expression Grounding

シェア:XThreadsFacebookLINEはてブBluesky

エージェントが自然言語指示に基づいて遠隔の物体を特定するタスクにおいて、視覚情報の種類に応じて専門化したスパース混合エキスパートを用いることで、ビューと物体の識別表現を改善し、既存手法を上回る性能を達成した。

詳しい要約

1. どんなもの?

ViSMoEは、Embodied Referring Expression Grounding(身体化された指示表現の接地)タスクのためのフレームワークである。このタスクでは、エージェントが実環境をナビゲートし、自然言語の指示に基づいて遠方の物体を特定する。ViSMoEは、スパースMixture-of-Experts(MoE)に視覚認識ルーティングポリシーを組み込み、ビューと物体の視覚情報を区別して処理することで、それぞれの表現を識別的にする。

2. 先行研究と比べてどこがすごい?

従来の手法は、ビューと物体を区別せず、バニラの視覚エンコーダで処理していたため、ビューと物体の表現が曖昧になる問題があった。ViSMoEは、視覚情報の種類に応じて専門化されたエキスパートをルーティングすることで、ビューと物体の表現を分離・強化し、この問題を解決している点が優れている。

3. 技術・手法の肝は?

手法の核心は、スパースMoEに視覚認識ルーティングポリシーを導入することである。具体的には、入力される視覚情報(ビューか物体か)に基づいて、異なるエキスパートを選択的に活性化する。これにより、ビューと物体で異なる特徴抽出が行われ、それぞれの表現がより識別的になる。

4. どうやって有効だと検証した?

REVERIEとSOONの2つのデータセットを用いて実験を行い、従来のstate-of-the-art手法と比較してViSMoEが優れた性能を示した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な問題についての議論は不明である。また、MoEの計算コストやルーティングの解釈性などについての考察も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、Embodied Referring Expression Groundingの分野では、REVERIEやSOONデータセットを用いた既存研究(例:ScanRefer, ReferIt3D)や、視覚言語ナビゲーション(VLN)の手法が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shuo Feng, Piji Li

分類: cs.CV

原文アブストラクト

Embodied Referring Expression Grounding is the task of enabling an agent to navigate in real environments and to localize a remote object based on natural language instructions. In this scenario, the agent needs to select one view for navigation at each step and identify a specific object among all candidate objects at the destination. However, most of the previous approaches fail to distinguish between views and objects, instead processing them using the vanilla vision encoder, which results in ambiguous representations of both views and objects. To address the above issues, we propose ViSMoE, which equips sparse Mixture-of-Experts with a visual-aware routing policy for the embodied agent. This framework processes different types of visual information specifically, resulting in discriminative visual representations for both views and objects. Experimental results on REVERIE and SOON datasets demonstrate that ViSMoE outperforms the previous state-of-the-art methods, showing the superiority of our proposed method.

関連論文