Abstract
OVD는 임의의 텍스트로 설명되는 객체 탐지를 목표로 하지만, 대부분 coarse한 수준에서 동작하며, 세밀한 속성에는 동작하는 데 어려움을 겪습니다. 해당 논문은 모델과 데이터 두 관점에서 이를 해결하고자 하였으며, 토큰 수준의 텍스트 특징에서 여러 의미론적 정보를 검색하는 attention 모듈과, 미분 가능한 AND 연산처럼 동작하는 soft-min 매칭 규칙을 사용하는 Semantic-Retrieval-Augmented Detector(SRA-Det)를 제안하였습니다. 또한, LLM을 이용하여 카테고리별 시각적 속성을 생성하고 두 종류의 CLIP 기반 유사도 검사를 통해 각 객체의 인스턴스 수준에서 속성을 검증하는 automatic attribute- augmented data pipelie을 제안합니다. 이를 통해 FG-OVD의 zero-shot 세팅에서 54.9 mAP, LVIS에서 40.4 AP를 달성하여, OVD에서 fine-grained와 일반화 성능을 입증하였습니다.
Introduction
Open-Vocabulary Object Detection(OVD)는 대규모 Vision-Language 사전학습을 활용하여 임의의 텍스트 쿼리로 객체의 위치를 찾고, 해당 객체를 인식하는 것을 목표로 합니다. 최근 Detic, GLIP/GLIPv2, GroundingDino 등이 COCO와 LVIS 등의 벤치마크에서 강력한 zero-shot 성능을 보였으며, 이러한 방법론들은 이미지와 텍스트 임베딩을 정렬하므로써 자유 형식의 텍스트 프롬프트에 대응이 가능하였습니다.
그러나, 기존의 평가는 대략적인 카테고리 인식에 집중하고있어, 모델이 색상, 형태, 재질과 같은 세부 속성을 이해하였는지는 고려하지 않습니다. 저자들은 이를 문제로 보았으며, 실제 환경에서는 정확한 세부 속성까지 동일한 객체를 탐지하는 것이 중요하다고 보고 이를 해결하고자 하였습니다.
일부 속성만 다른 부정 표현인 hard negative를 이용하는 Fine-grained OVD 벤치마크에서 기존 탐지기를 평가하면 성능이 크게 저하되는 것을 통해, coarse한 카테고리 인식과 세밀한 속성 이해 사이에 격차가 존재함을 알 수 있으며, 최근 이를 해결하기 위한 연구들이 이루어지고 있습니다. 그러나 최신 연구들도 하나의 설명 전체를 최종적으로 하나의 텍스트 표현으로 압축하는 방식으로, 저자들은 이로 인해 category 정보가 속성 단서를 가릴 수 있으며, 하나 이상의 속성을 만족하지 않는 경우에도 높은 점수가 부여될 수 있다는 문제가 존재한다고 주장합니다.
따라서 저자들은 (1) 시각적 매칭 과정에 텍스트를 어떻게 표현할 것인가; (2) 대규모로 세밀한 속성 감독 정보를 어떻게 확보할 것인가; 이 두가지에 집중하여 문제를 해결하고자 하였습니다. 먼저, 모델 측면에서 설명을 여러 의미론적으로 명시적으로 분해하고, 탐지된 객체가 이를 모두 만족하도록 하는 Semantic-Retrieval-Augmented Detector(SRA-Det)를 제안합니다. SRA-Det는 텍스트 토큰으로부터 여러 개의 상호보완적인 의미적 측면을 검색하고, 객체와 각 의미적 측면의 유사도를 따로 계산하여 soft-min으로 통합 합니다. 이를 통해 하나의 핵심 속성이라도 일치하지 않으면 최종 점수가 낮아지도록 합니다.
또한, 데이터 측면에서 대규모 탐지 데이터셋에 세밀한 속성 감독 정보를 확장하기 위해 automatic attribute- augmented data pipelie을 제안합니다. 속성 생성 시 LLM의 지식을 기반으로 시각적 속성 후보를 만들고, 객체의 관심 영역과 일치하는 속성을 vision-language 모델의 이중 검사를 통해 선택하여 학습에 사용합니다.
최종적으로 SRA-Det는 FG-OVD zero-shot 평가에서 54.9 mAP를 기록해 기존 OWL-ViT L/14보다 13.8 mAP 높은 성능을 달성하였으며, 일반적인 범주 수준 평가인 LVIS에서도 강한 성능을 유지하였다고 합니다.
해당 논문의 contribution을 정리하면,
- 텍스트 설명을 여러 의미론적 측면으로 분해하고, 다중 의미론적 매칭 방식을 통해 의미론적 일치를 강화하는 Semantic-Retrieval-Augmented Detector(SRA-Det) 제안
- LLM 기반의 속성 생성과 CLIP 기반의 인스턴스 수준 검증을 결합하여 높은 시각적 속성을 학습할 수 있게 하는 확장 가능한 attribute-augmented data pipeline 제안
- 다양한 실험을 통해 FG-OVD의 zero-shot 세팅에서 SOTA를 달성하였으며, LVIS 에서 경쟁력있는 OVD 성능 달성
Method
방법론은 크게 모델 관점과 data pipeline 관점에서 다룹니다.
Semantic-Retrieval-Augmented OVD Model (SRA-Det)

OVD 모델은 일반적으로 전체 텍스트를 하나의 임베딩 벡터로 압축하는 방식으로, 색상이나 구성 부위, 자세와 같은 정보와 같은 다양한 측면의 단서가 포함될 경우에는 잘 동작하지 않게 됩니다. 따라서 저자들은 텍스트로부터 핵심 의미론적 단서를 반복적으로 검색하여, 객체 특징과 정렬하는 Semantic-Retrieval-Augmented Detector(SRA-Det)를 제안합니다. 모델 구조는 위의 Figure 2에서 확인할 수 있으며, Transformer를 기반으로 구성됩니다. Object Detector는 이미지 인코더를 통해 이미지 특징을 추출하고 객체 쿼리를 생성하며, 이후 객체 디코더를 통해 객체 쿼리를 정제하여 최종 탐지 결과를 생성합니다. 텍스트 인코더는 카테고리 명과 자유 형식의 설명을 객체 쿼리와 매칭할 수 있는 텍스트 임베딩으로 변환합니다.
텍스트의 의미를 충분히 활용하기 위해 저자들은 텍스트 표현을 강화하는 Semantic Retrieval Augmentation을 제안하였으며, 이를 새로운 Multi-Semantic Matching과 함께 사용하여 객체의 시각적 특성과 텍스트 설명을 여러 의미 수준에서 매칭하도록 학습합니다.
[ Semantic Retrieval Augmentation ]
먼저, Semantic Retrieval Augmentation 모듈은 K번의 검색 쿼리\mathbf{Q}=\{q_1, ... , q_K\} \in \mathbb{R}^{K⨉C}와 텍스트 토큰 임베딩 \mathbf{H}=\{h_1, ... , h_L\} \in \mathbb{R}^{L⨉C}이 입력으로 들어옵니다. 텍스트 인코더의 마지막 계층에서 얻은 토큰 임베딩 중, [SOS]와 [EOS]토큰을 제외한 특징을 전체 의미 정보의 source로 사용하며, 각 검색 쿼리 q_k는 전체 텍스트 토큰에 attention을 적용하여 새로운 정보 r_k를 추출합니다.

K개의 \mathbf{R}=\{r_1, ... , r_K\} \in \mathbb{R}^{K⨉C}는 검색 쿼리가 서로 다른 정보에 집중할 수 있도록 하며, 이때 K개의 쿼리에 대해 학습 가능한 positional embedding \mathbf{P}=\{p_1, ... , p_K\} \in \mathbb{R}^{K⨉C}를 통합합니다. 이전 검색 쿼리에 위치 임베딩을 더한 뒤 layer normalization(LN)을 수행하여 검색 쿼리를 구성하게 되며,

초기 쿼리는 global pooling된 토큰 r_0 = AvgPool(\mathbf{H})으로 사용합니다.
r_k는 global 텍스트 임베딩 h_{eos}이 더해져 의미론적 정보가 증강되며,

마지막으로 h_k와 h_{eos}를 linear projection하고 L2 정규화한 뒤 결합하여 여러 의미를 나타내는 증강된 텍스트 표현 \hat{\mathbf{H}}=\{\hat{h}_1, ... , \hat{h}_K\} 를 생성합니다.

즉, 하나의 텍스트 설명에 대해 K개의 증강된텍스트 임베딩 \hat{h}_k가 만들어지게 됩니다.
[ Multi-Semantic Matching ]
하나의 객체 쿼리를 K개의 텍스트 표현과 비교한 점수를 계산한 뒤 AND 연산 역할을 할 수 있는 soft-min으로 통합하여 전체 속성을 고려한 최종 점수를 계산하게 됩니다. 구체적으로, 각 물체의 object query v_i \in \mathbb{R}^{C}에 대하여 모든 증강된 텍스트 표현 \hat{\mathbf{H}}과의 유사도를 개산하여 K개의 semantic score s_{i,k}를 구합니다.
저자들은 텍스트에서 설명하는 모든 의미 단서를 만족(AND 조건)해야 한다고 보았으며, 모든 semantic score가 높으면 최종 매칭 점수가 높고, 하나라도 불일치할 경우 최종 매칭 점수가 낮도록 설계하였습니다. 또한, 학습 가능하도록 만들기 위해 Soft-min 수식을 도입하였습니다.

- s_i는 i번째 객체 쿼리의 최종 매칭 점수
- \tau는 soft-min 동작을 조절하는 하이퍼파라미터
이를 통해, 여러 점수가 비슷할 때는 평균처럼 동작하고, 하나의 점수가 다른 점수보다 현저히 작을 경우 최솟값처럼 동작할 수 있도록 설계하였습니다.
[ Attention Optimization ]
먼저, 서로 다른 검색 쿼리가 텍스트의 서로 다른 영역에 집중하도록 만들기 위해 Diversity loss \mathcal{L}_{div}를 도입합니다. 서로 다른 두 attention 분포가 유사할수록 loss가 커지므로 서로 다른 측면에 집중할 수 있도록 학습됩니다.

또한, 모든 유효 텍스트 토큰이 전체적으로 다뤄지도록 유도하기 위해 Coverage loss \mathcal{L}_{cov}를 도입합니다. 각 토큰 j에 대해 평균 attention을 계산한 뒤, 이를 균등한 토큰 분포 1/L 에 가깝도록 만들어 특정 토큰에만 attention이 집중되고 나머지 설명을 무시하는 현상을 막습니다.

저자들은 이 두 가지 loss를 함께 최적화에 사용합니다.
Attribute-Augmented Data Pipeline
대규모 open-vocabulary detection 데이터셋은 다양한 카테고리를 포함하지만, 일반적으로 시각적 속성에 대한 세밀한 annotation 정보는 부족합니다. 그러나 시각적 속성은 범위가 넓고, 매우 다양한 조합이 가능하며, 수작업으로 annotation을 하는 데는 지나치게 많은 비용이 소요됩니다. 그러나 기존의 Vision-Language 모델을 이용하는 방식은 노이즈와 hallucination이 포함될 가능성이 존제합니다.
이러한 문제를 해결하기 위해 저자들은 카테고리별 시각적 속성을 확장 가능하고 효율적으로 추가하는 자동화된 데이터 파이프라인을 제안합니다. 해당 파이프라인은 3 단계로 구성됩니다.
1. Attribute Generation from Category Priors
먼저 detection 데이터셋의 각 카테고리에 대해 LLM을 통해 시각적 속성 후보를 생성합니다. 이때 다음 조건을 만족하도록 합니다.
- 속성은 구별력이 있어야 하며, 순수하게 시각적 속성이어야 함 (e.g. 색상, 형태, 구성 부위, 재질, 질감, 패턴, 위치 또는 상태)
- 부정 표현은 제외하고 긍정 속성만 사용
- 기능, 용도, 장소와 같은 비시각적 속성은 제외
2. CLIP-Based Feature Extraction
각 객체의 안정적 시각 특징을 얻기 위해, 이미지의 RoI를 잘라 CLIP 이미지 인코더로 feature f_{roi}를 추출한 뒤, RoI 영역을 20%, 40% 확장하고 수평 반전을 적용하여 얻은 특징과 평균을 구하고 L2-normalize를 적용하여 최종 시각 표현 \hat{f}_{roi}를 만듭니다.
속성의 텍스트 특징은 두가지 방식으로 생성합니다.
- 정해진 멀티 템플릿 (e.g. "a {category} that has {attribute}" / "a {category} with {attribute}")으로 카테고리명과 속성을 결합하여 여러 프롬프트 문장으로 만들어 CLIP 텍스트 인코더로 인코딩한 뒤, 특징의 평균을 구하고 L2-normalize를 적용한 \hat{f}_{attr}^d를 구함. (즉, 속성별로 멀티 템플릿간의 평균-정규화로 구해진 속성 특징을 갖는 것입니다.)
- 속성과 카테고리명을 별도로 인코딩하여 f_{attr}, f_{class}를 구한 뒤, 두 특징을 더하여 L2-normalize를 적용하여 속성 특징 f_{attr}^c 를 생성
3. Attribute Annotation
앞서 생성한 특징과 객체 RoI 사이의 매칭 점수를 아래의 식과 같이 계산합니다.

이후 아래의 조건을 모두 만족하는 속성만 남기며, \lambda는 신뢰도의 임계치입니다.

즉, 속성에 대한 매칭 점수가 임계치보다 높고, 카테고리 명과의 유사도보다도 높아야 하는 것 입니다. 이러한 과정을 통해 노이즈와 시각적으로 근거가 약한 속성을 제거하게 됩니다.
Experiments
Dataset
학습 데이터는 객체 탐지 데이터셋 Objects365v2(66만 장), V3Det 과 속성 데이터셋 VAW, Grounding 데이터 GoldG를 이용하였으며, 객체 탐지 데이터셋에 Attribute-Augmented Data Pipeline을 적용하여 카테고리별 시각적 속성을 추가합니다. 속성 생성 시 LLM은 DeepSeek V3.1 API를 사용하였다고 합니다. 또한 VAW 데이터의 경우 공정한 평가를 위해 COCO 학습 데이터와 중복되는 이미지는 제거하였다고 합니다.
평가는 LVIS와 FG-OVD 벤치마크를 이용합니다. LVIS는 1203개의 카테고리를 포함하며, OVD 평가에 널리 사용됩니다. 저자들은 5000개의 minival split에서 평가한 뒤 공정한 비교를 위해 zero-shot fixed AP를 리포팅합니다. FG-OVD는 총 8개의 하위 데이터셋으로 구성되며, 난이도 기반 시나리오와 속성 유형 기반 시나리오로 구성됩니다. 평가에는 설명과 속성 일부만 다른 hard-negative 설명을 함께 사용하여, 모델이 색상·재질·패턴·투명도 같은 세부 속성을 실제로 구분하는지 평가하였다고합니다.
Zero-Shot Performance on LVIS

Table 1은 LVIS minival에서 SRA-Det와 대표적인 OVD 방법론들으 비교한 결과입니다. Swin-T 백본을 사용한 SRA-Det는 40.4AP의 경쟁력 있는 성능을 달성하였습니다. (표에 FG-OVD가 들어있는데 성능 어필을 위해 Table 2에 들어갈 성능을 끌어온것입니다.) LLMDet가 가장 좋은 성능을 달성하였으며, 저자들은 LLMDet가 MM-GDINO를 fine-tuning한 모델로 학습 과정에 COCO 데이터도 사용하기 때문이라고 분석하였습니다.
Zero-Shot Performance on FG-OVD

Table 2는 FG-OVD에서 성능을 나타낸 것입니다. SRA-Det가 가장 좋은 성능을 보였으며, 특히 Zero-shot 세팅에서 8개의 sub-dataset에 대해서 모두 가장 높은 성능을 달성하였습니다. (Trivial에서는 Detic와 동일한데 bold를 안했네요) 저자들은 FG-OVD 벤치마크에 특화된 fine-tuning을 수행하지 않았음에도 fine-tuning 된 NoctOWLv2보다 좋은 성능을 달성하였다는 점을 어필합니다.
추가로 fine-grained OVD 방법론들고 공정한 평가를 위해 저자들은 SRA-Det를 FG-OVD 학습 데이터로 추가 fine-tuning 한 결과를 함께 리포팅하였습니다. SRA-Det는 67.8 mAP를 달성하였으며, GUIDED(neurips 2026)보다 1.4 mAP 높은 성능을 달성하였습니다. 이를 통해 fine-tuning 환경에서도 성능 개선이 이루어진다는 점을 어필하였습니다.
MLLM Comparison

저자들은 FG-OVD 평가 프로토콜에서 MLLM과도 비교하엿습니다. 비교한 모델들에 비해 훨씬 작은 모델임에도 F1과 Recall에서 높은 성능을 기록하였음을 어필합니다. 정확도 측면에서는 아무래도 이기기 어렵네요.
Generalization to Other Fine-Grained Benchmarks

또한, 저자들은 FG-OVD 이외의 환경에서도 성능을 검증하기 위해 OmniLabel과 OVDEval에서 평가를 수행하였습니다. 다른 모델들이 더 큰 백본을 이용하거나 더 많은 학습 데이터를 사용했음에도 Swin-T 기반의 SRA-Det가 일관되게 좋은 성능을 보였다는 점을 어필합니다.
Ablation study

Table 5는 데이터가 추가됨에 따른 성능 변화를 나타낸 것입니다. Attribute-Aug. Data가 저자들이 제안한 데이터 파이프라인으로 증강한 데이터입니다.

Table 6은 SRA 모듈의 기여도에 대한 검증 결과입니다. global 텍스트 임베딩 만으로도 coare한 수준의 객체 인식에는 충분할 수 있으나, 세밀한 객체 인식에는 저자들이 제안한 모듈이 도움이 된다는 것을 실험적으로 확인하였습니다.
Visualization of Semantic Retrieval

Figure 3은 모델이 세밀한 매칭을 어떻게 수행하는 지 보여주는 시각화 결과입니다. 색상은 진할수록 높은 가중치가 부여된 것 입니다. 왼쪽 위의 예시에서 모델은 “a grey metal knife with a black plastic handle”이라는 텍스트를 올바르게 선택합니다. 반면 두번째 문장은 ratten이라는 속성 잘못된 속성이 포함되어있으며, 이처럼 하나의 속성이 일치하지 않아도 Multi-Semantic Matching 모듈이 전체 매칭점수를 낮추어주는 것을 확인할 수 있습니다.
리뷰 잘 읽었습니다. 질문이 있어 남겨두겠습니다
1. SRA-Det는 텍스트 설명에서 K개의 semantic representation을 검색한다고 하셨는데, 이 K값은 고정인지, 아니면 문장 길이나 속성 개수에 따라 달라지는지는건지요? 그니까 설명마다 포함된 속성 수가 다를 텐데 고정된 K가 충분한지 의문이 드네요
2. soft-min은 AND 조건처럼 동작해서 fine-grained negative를 잘 걸러낼 수 있다는 장점이 있다고 하신 것 같은데.. 반대로 일부 속성이 occlusion이나 조명 때문에 잘 보이지 않는 경우에는 그 객체의 점수도 과하게 낮아질 수 있을 것 같습니다 (아닌가요?) 이게 승현님 상황에서는 고려할 필요는 없는건지 혹은 어떻게 생각하시는지!?
3. Attribute-Augmented Data Pipeline에서 LLM이 생성한 속성을 CLIP 기반 similarity로 검증한다고 하셨는데, CLIP 자체도 fine-grained attribute 구분에 약하지 않나….. 하는 의문이 드네요. 그러다보니 CLIP 검증기를 사용한 attribute annotation이 노이즈를 충분히 제거한게 맞는지 궁금합니다
안녕하세요 승현님 좋은 리뷰 감사합니다!
Attribute-Augmented Data Pipeline에서 카테고리에 대한 시각적 속성 후보를 생성하는 첫 단계에 대한 질문이 있습니다. 속성 후보를 생성할 때 카테고리 이름만 주고 생성을 하도록 하는 방식인가요? 만약 그렇다면 카테고리의 전형적이고 일반적인 속성 후보 위주로만 뽑힐 것 같은데, 변별력이 있는 정보가 포함되는지 궁금합니다. 그리고 저자들이 몇 개의 속성을 사용했는지 궁금합니다.
감사합니다.
안녕하세요 승현님 좋은 리뷰 감사합니다
Visualization of Semantic Retrieval의 (b)의 경우 plastic helmet은 이미지와 연관관계보다는 객체의 고유 특성 (헬멧은 플라스틱이 일반적)이 관여했을 수 있을것 같습니다. 이런 상식/고유속성과 이미지 그라운딩을 보이는 요소에 대해 모델의 능력을 구분하여 리포팅한 실험이 추가로 있는지 궁금합니다.