何が起きたか

arxiv.orgに2026年6月15日付で掲載された論文「ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation」において、研究チームはSAM 3をベースにした訓練不要のゼロショット推論フレームワークActiveSAMを提案した。ActiveSAMは、画像ごとにアクティブなクラスのみをフル解像度でデコードすることで、8つのベンチマークで平均mIoUを約+1.4向上させ、大語彙データセットでは最大5.5倍の高速化を達成したとしている。

詳細

ActiveSAMは、まずクラスプロンプトを正規化・拡張し、低解像度のプレゼンスプレビューから画像条件付きのアクティブセットを推定する。保持されたクラスのみがフル解像度でデコードされ、バケット化されたプロンプト多重化と凍結されたSAM 3デコーダが使用される。プレビュー段階ではクラスの存在証拠のみを使用し、不要なセグメンテーションヘッドの計算をスキップする。最終段階ではマージン認識の背景キャリブレーションを適用して低信頼度ピクセルを抑制する。ActiveSAMはターゲットデータセットのトレーニング、重み更新、オラクルのクラス存在ラベルを必要としない。

Key Facts

ActiveSAMはSAM 3をベースにした訓練不要のゼロショット推論フレームワークである。[1]
ActiveSAMは8つのOVSSベンチマークで、SegEarth-OV3と比較して平均mIoUを約+1.4向上させた。[1]
ActiveSAMは大語彙データセットで最大5.5倍高速に動作する。[1]
ActiveSAMは画像破損に対する堅牢性で最強のパフォーマンスを示し、自動運転や身体化AIなどのノイズの多い入力領域に適しているとしている。[1]
コードはhttps://github.com/VILA-Lab/ActiveSAMで公開されている。[1]

本紙の見方

今回のActiveSAMの提案は、Segment Anything Model 3(SAM 3)をオープンボキャブラリ semantic segmentation(OVSS)に適用する際の非効率性に着目した点で新規性がある。従来の手法では、全データセットの語彙に対してフル解像度のデコードを実行していたが、実際の画像には少数のアクティブなクラスしか含まれない。ActiveSAMは、画像ごとにアクティブなクラスのみを選択的にデコードすることで、計算コストを削減しつつ精度を向上させる。これは、訓練不要でゼロショット推論を実現する点で、既存のSegEarth-OV3などの手法と比較して、速度と精度のトレードオフを改善するものとみられる。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、SAMシリーズの進化とその応用に関する文脈で捉えることができる。SAM 3は強力な凍結バックボーンを提供するが、OVSSへの直接適用は非効率であり、ActiveSAMはそのギャップを埋めるものだ。 業界構造への含意として、ActiveSAMは自動運転や身体化AIなど、ノイズの多い入力領域での展開を想定している。これらの分野では、リアルタイム性と堅牢性が重要であり、ActiveSAMの高速化と堅牢性は実用的な価値を持つ。また、訓練不要であることは、データセットごとの再学習コストを削減し、導入のハードルを下げる可能性がある。 未確定の論点としては、ActiveSAMの実際の推論速度や精度が、特定のハードウェアやデータセットでどの程度の性能を発揮するかは、論文の実験条件に依存する。また、SAM 3のライセンスや商用利用の制約が、実用化に影響を与える可能性がある。さらに、ActiveSAMの手法が他のセグメンテーションタスクやモデルにも適用可能かどうかは、今後の研究で検証されるべき点である。

なぜ重要か

ActiveSAMは、オープンボキャブラリ semantic segmentation の実用化に向けた重要な一歩であり、特に自動運転や身体化AIなど、リアルタイム処理と堅牢性が求められる分野での応用が期待される。訓練不要で高速な推論を実現することで、エッジデバイスでの展開可能性を広げる。