Abstract
retrieval에서 embedding 생성에 사용되는 대부분의 모델은 다른 목적으로 학습이 되다 보니 물체의 세부 속성보다 coarse한 물체에 집중하는 경향이 있습니다. 또한, 서로 다른 description을 구분하는 능력을 학습하는 것을 목적으로 하지 않아 유사하지만 사실적으로는 다른 것을 구분하는 능력이 부족합니다. 이를 해결하기 위해 본 논문은 POGA(Paraphrased and Oppositional Graph Alignment)라는 새로운 fine-grained cross-modal alignment 프레임워크를 제안합니다. POGA는 (1) paraphrased positive와 oppositional negative 표현을 생성할 뿐만 아니라 이미지와 텍스트 변형을 그래프로 파싱하여 풍부한 정보를 제공하는 Multi-Source Graph Augmentation(MSGA)를 제안 하였으며, (2) 모델을 전역 및 미세 수준에서 동시에 최적화하는 Hybrid Multi-granularity Alignment(HMA)를 제안하였습니다. 저자들은 DCI와 DOCCI 벤치마크에서 다양한 실험을 진행하였으며, POGA의 long-text 이해 능력 및 복잡한 관계 판단에서 우수한 성능을 보였다고합니다.
Introduction
cross-modal retrieval은 e-commerce에 활용되는 연구로, 텍스트와 이미지 사이의 세부적인 정보 정렬이 중요합니다. 최근 CLIP의 등장으로 텍스트와 이미지를 공통 임베딩 공간에 정렬하여 zero-shot 일반화가 가능해졌으며, 이를 기반으로 한 cross-modal retrieval 연구들도 활발히 이루어지고 있습니다. 그러나 CLIP은 제한된 context length(77개 token) 내에서 텍스트를 처리하도록 설계되어 제품 설명과 같은 long-text의 세부 속성 정보를 충분히 반영하는 데 어려움이 있습니다. 또한, CLIP의 global alignment 방식은 이미지와 텍스트를 전체 수준에서 정렬하기 때문에, fine-grained한 속성 정보를 이해해야 하는 task에서 성능 저하의 원인이 되기도 합니다.

따라서 최근 long-text를 처리하기 위한 Long-CLIP, TULIP 등의 연구들이 등장하였으며, 이러한 연구들은 long-text 데이터 셋을 활용하고 positional encoding을 확장하는 등의 방식으로 더 긴 텍스트를 처리하고자 하였습니다. 그러나 이러한 연구들도 여전히 전체 이미지와 문단을 각각 하나의 global vector로 압축하여 정렬하는 CLIP의 global feature alignment 방식을 따르고 있어, 객체,속성, 관계와 같은 세부적인 정보를 충분히 반영하기 어렵습니다. 저자들은 이러한 한계로 인해 “a cat on a mat”와 “a cat under a mat”와 같이 전치사 하나가 달라져 서로 다른 이미지를 의미하는 경우에 충분히 구분하지 못할 수 있다고 설명합니다. 또한, Figure 1을 통해 전체 이미지와 캡션 사이의 global alignment에 기반한 방법론들이 작은 객체나 드문 객체를 놓치고, 객체의 속성과 배치 관계의 중요도를 낮게 반영하는 경향이 있다는 것을 보였습니다.
또한, 다양한 연구들에서 VLM이 fine-grained 공간적 관계와 속성 등을 이해하는 데 어려움을 겪는다는 것을 입증하였으며, 이를 해결하기 위해 세부 속성 alignment에 집중한 많은 연구들이 등장하였습니다. 그러나 이러한 연구들은 local alignment에 집중하여 객체 사이의 복잡한 관계나 구조적 정보를 모델링하고 추론하는 메커니즘이 부족하며, 구분 능력이 부족하여 의미론적으로 유사하지만 사실적으로 틀린 설명(counterfactual)을 식별하는 데 어려움이 있습니다.
저자들은 이를 해결하기 위해 POGA(Paraphrased and Oppositional Graph Alignment)라는 long-text fine-grained retrieval을 위한 새로운 프레임워크를 제안하였습니다. POGA는 MSGA 모듈을 통해 풍부한 표현을 학습하며, HMA를 통해 다양한 수준의 세부성을 함께 최적화합니다.
해당 논문의 contribution을 정리하면,
- Multi-source Graph Augmentation(MSGA) 모듈을 제안. MSAG는 LLM을 통해 이미지와 텍스트를 구조화된 그래프로 파싱하고, paraphrased positive와 counterfactual negative를 포함하는 증강 데이터를 생성하며, 변경된 차이를 자동으로 추출하여 모델에 학습 신호를 제공
- Hybrid Multi-granularity Alignment(HMA) 프레임워크를 설계. HMA 프레임워크는 global, node, relation, focal disproving 수준을 동시에 최적화하는 training objective로, 이를 통해 객체 속성과 공간적 관계를 정밀하게 인식하고 사실적 오류를 효과적으로 구분할 수 있도록 함
- DCI, DOCCI, Urbal1K를 포함한 다양한 벤치마크에서 전반적으로 SOTA를 달성. 이를 통해 저자들이 제안한 graph alignment paradigm이 long-text 기반 fine-grained understanding 능력 향상에 효과적임을 검증
Method
기존 VLMs은 이미지와 텍스트 사이의 global한 정렬에 집중하여 세밀하고 복잡한 정보를 이해하는 데 어려움을 겪습니다. 이로 인해 부정 표현이나 관계의 차이를 이해하는 데 어려움을 겪으며, 이를 해결하기 위해 저자들은 POGA라는 프레임워크를 제시합니다. POGA는 데이터 증강 방식과 Multi-level contrastive learning을 통해 fine-grained 객체 인식 능력과 구조적 공간적 이해 능력, factual disproving 능력(주어진 설명에 대한 사실 여부 판별 능력)을 향상시키고자 하였습니다.
1. Multi-source Graph Augmentation (MSGA)

먼저 저자들은 언어적 다양성과 adversarial factuality(속성·객체·관계에 변화를 주어 사실 관계를 바꾼 것)에 집중하여 데이터 증강 방식을 설계하였습니다. 먼저, 최신 LLM을 통해 상호보완적인 텍스트 변형을 생성하였다고 합니다.
먼저 InternVL-3로 이미지 I를 다시 묘사하여 동일한 의미는 유지하면서 문법적 표현만 바꾼 paraphrased positive인 T_{pos}를 생성합니다. 이를 통해 텍스트가 포함한 의미와, 표면적인 문장 형태를 분리하고 모델이 단순한 동의어나 paraphrased 표현에 대해서도 견고하게 의미론적 representation을 학습하도록 합니다.
동시에 Llma-8B와 같은 언어 모델을 사용하여 원본 텍스트 T_{orig}의 하나의 세부 정보를 변형한 counterfactual negative T_{neg}를 생성합니다. 예를 들면, red→blue로 속성을 바꾸거나, on→under로 관계를 바꾸거나, cat→dog로 객체를 바꾸는 것 입니다. 이를 통해 생성한 hard negative는 모델의 disproving 능력(사실여부 판단 능력) 학습에 사용합니다.
또한, 저자들은 long-text의 의미는 구조화되어있으므로, 이미지와 텍스트를 모두 graph representation으로 명시적으로 파싱하는 방법을 사용합니다. 이미지에 SAM과 같은 segmentation을 적용하여 region node 집합 \mathcal{V} =\{ (v^{sem}_i, v^{spat}_i) \}을 생성합니다. v^{sem}_i는 공간 좌표계를 의미하며, v^{spat}_i 은 CLIP 비전 인코더를 사용하여 추출한 semantic feature입니다. 텍스트 \{T_{orig}, T_{pos}, T_{neg}\}는 GPT-4o-Mini와 같은 LLM parser를 이용하여 scene graph G = (\mathcal{E}, \mathcal{R})를 생성합니다. 여기서 \mathcal{E}는 entity node집합(객체와 속성), R은 relation triple 집합(주어-서술어-목적어)입니다.
저자들은 Modified Difference Information M_{diff}를 추출하는 것을 제안합니다. LLM에 원본 텍스트에 대한 graph G_{orig}와 negative 에 대한 그래프 G_{neg}를 함께 입력한 뒤, 둘을 비교하도록 discrepancy report M_{diff} = \{ (e_{target},\tau_{err},e_{modified}) \}를 출력합니다. 여기서 \tau_{err} \in \{ATTR/OBJ_ERR,REL_ERR\}로 문제가 entity(객체 혹은 속성)와 relation중 어디에서 발생하였는지를 나타내고, e_{target}과 e_{modified}는 원본 그래프외 변경된 그래프 요소를 나타냅니다. 이렇게 구해진 M_{diff}를 포함하여 풍부한 정보가 포함된 augmented data \mathcal{D}_{aug}=\{I,T_{orig},T_{pos},T_{neg},G_{I},G_{\{orig,pos,neg\}},M_{diff}\}를 구축하여 학습에 사용합니다.
2. Hybrid Multi-granularity Alignment (HMA)

HMA는 4가지 항으로 구성된 목적함수를 정의하여 global한 의미론적 수준 뿐만 아니라 세밀한 entity구조, disproving 수준에서 최적화를 수행합니다. 저자들은 multi-task objective를 사용하며, global 이해 능력은 유지하면서도 점진적으로 세부적인 구분 능력, 특정 정보에 대한 사실여부 판단등을 판별할 수 있도록 합니다. 구조는 위의 Figure 3에서 확인하실 수 있습니다.
1. Dual Global Alignment Loss
저자들은 언어의 다양성을 위해 I, T_{orig} 뿐만 아니라 paraphrased positive T_{pos}를 함께 학습에 사용합니다. InfoNCE loss를 사용하며, 두 loss의 평균을 이용합니다.

2. Hierarchical Node Contrastive Loss
global alignment른 이미지와 텍스트를 하나의 벡터로 압축한 것으로, 객체 수준의 세부 정보를 고려하지 못합니다. 따라서 저자들은 이미지 영역와 텍스트 사이의 정밀한 gorunidng을 강화하기 위해 multi-positive/multi-negative object를 제안합니다. 이미지 영역 v_i에 대하여 T_{orig}와 T_{pos}에서 파싱된 entity를 positive set \mathcal{P}_i로 구성하고, 배치 내의 다른 entity와 T_{neg}에서 바뀐 잘못된 entity를 negative set \mathcal{N}_i로 구성합니다. 이후 positive는 가까워지고, negative는 멀어지도록 contrastive learning을 수행합니다.


3. Structural Alignment Loss
저자들은 두객체 사이의 공간적·구조적 관계를 학습하기 위해 Structural Alignment Loss를 제안합니다. 앞선 Hierarchical Node Contrastive Loss가 이미지의 특정 영역이 어떤 entity와 대응되는지를 학습하였다면, Structural Alignment Loss는 두 객체가 어떤 관계인지를 학습하기 위한 것 입니다.
주어와 목적어에 해당하는 visual feature (v_{sub},v_{obj}), relation text T_{rel}를 transformer 디코더로 구성된 Relational Reasoning Module(RRM)에 입력하여 confidence score s(v_{sub},v_{obj},t_{rel}) \in [0,1]를 구합니다. RRM은 사실여부를 판단하는 역할을 하며, ㅆ_{orig}와 G_{pos}에서 positive triple set \mathcal{R}^+, 배치 내에서 랜덤하게 수집된 subject-object-relation으로 negative triple set \mathcal{R}^-를 구축하여 학습합니다. loss는 아래의 식으로 정의되며, 올바른 관계는 높은 점수를 갖도로, 잘못된 조합이나 관계는 낮은 점수를 갖도록 학습됩니다.


4. Focal Disambiguation Loss
마지막으로, 저자들은 counterfactual negative에서 정확히 어떤 부분을 틀렸는지 알아내기 위해 Focal Disambiguation Loss를 추가합니다. T_{neg}에서 의도적으로 바꾼 특정 요소를 직접적으로 반박하도록 학습시키기 위해 M_{diff}를 활용합니다. 오류는 attribute/object error(entity node 오류)와 relation error(relation triple오류)로 두가지 유형으로 구분됩니다.
먼저 attribute/object error의 경우(예를 들어 red→blue 혹은 cat→dog로 바뀐 경우), 이미지 영역 v과 원본 텍스트 T_{orig} 사이의 유사도s_{pos}=sim(v,T_{orig})가 T_{neg} 사이의 유사도s_{neg}=sim(v,T_{neg})보다 크도록 hinge loss를 적용합니다. loss는 아래의 식으로 정의되며,

모든 ATTR/OBJ_ERR에 대하여 평균 오차를 구합니다.

두번째 유형인 relation error의 경우(예를 들어 “cat on the mat”이 “cat under the mat”으로 바뀐 경우) RRM이 잘못된 relation tirple r_{neg}에 대해 confidence를 낮추도록 해당 triple의 score가 0에 가까워지도록 BCE loss를 적용합니다.

최종적으로 두 유형의 오차를 합하여 \mathcal{L}_{focus}를 구합니다.

Total Objective
최종적으로 저자들은 위의 4가지 loss를 가중합하여 학습을 진행합니다.

저자들은 \mathcal{L}_{global}과 \mathcal{L}_{node}를 통해 이미지에 대한 전반적인 이해뿐만 아니라, \mathcal{L}_{relation}을 통해 객체들 사이의 관계, \mathcal{L}_{focus}를 통해 무엇이 잘못되었는지에 대하여 정확히 파악할 수 있도록 학습하는 것을 목표로 하였습니다.
Experiments
POGA 프레임워크의 효과를 평가하기 위해 저자들은 다양한 벤치마크에서 결과를 비교합니다. 평가는 in-distribution 환경의 평가, cross-dataset 일반화 능력, global representation 유지 능력, ablation study로 구성됩니다.
Dataset
실험은 주로 long-text image-text retrieval 데이터 셋인 DCI와 DOCCI에 대하여 이루어지며, 해당 데이터셋은 상세한 설명을 포함하고있습니다. 추가로 cross-dataset 일반화 능력 평가를 위해 Urban1K 데이터셋을 활용하였으며, global represenation 유지 능력 평가를 위해 CIFAR10/100, ImageNet-O에 대하여 zero-shot classification 에 대한 평가를 진항하였다고 합니다.
Evaluation Metrics
평가지표는 image-text retireval에서 표준 지표인 Recall@K(K=1,5,25,50)를 사용하였으며, zero-shot classification에 대해서는 classification accuracy를 사용합니다.
Experimental Results
[ In-distribution image–text retrieval ]

Table 1은 동일 학습-평가 셋에서 image-text retrieval 성능을 평가한 결과입니다. 저자들이 제안한 방식이 모두 SOTA를 달성하였습니다.
[ Cross-dataset generalization between DCI and DOCCI ]

TAble 2는 cross-dataset 에 대한 평가 결과로, 한 데이터 셋에서 학습한 뒤, 학습에 사용되지 않은 데이터 셋으로 평가를 수행한 결과입니다. 마찬가지로 모든 케이스에서 가장 좋은 성능을 보였으며, 이를 통해 강력한 cross-dataset 일반화 능력을 보였습니다.
[ Cross-dataset generalization to Urban1k ]

추가로 저자들은 Urban1k 데이터 셋에 대하여 일반화 성능을 평가하였습니다. 대부분의 경우에서 우수한 성능을 보였으며, 해당 실험을 통해 저자들은 새로운 데이터 분포와 scene에도 효과적으로 전이가 가능함을 보였습니다.
[ Global representation retention capability ]

fine-grained task에 맞추어 미세조정 후, 사전학습된 global representation이 유지되고 있는지 평가하기 위해 저자들은 zero-shot classification을 수행합니다. 실험을 통해 POGA가 fine-grained image-text matching 능력을 크게 향상시키면서도, 모델이 원래 가지고 있던 global visual understanding 능력을 유지하거나 오히려 강화할 수 있음을 보였습니다.
[ Ablation study ]

Table 5는 저자들이 제안한 구성 요소에 대한 실험 결과입니다. HMA 에서 loss를 순차적으로 추가함으로써 성능이 점차 개선되는 것을 확인할 수 있습니다. 이를 통해 global alignment 뿐만 아니라, node-level의 정렬, relation-level의 정렬, 사실여부 판단 능력이 모두 필요하다는 것을 입증하였습니다. 또한, MSGA의 경우 T_{pos}와 T_{neg}를 함께 사용함으로써 POGA의 강인성과 fine-grained 구분 능력을 높일 수 있었다는 것을 보였습니다.
Parameter Sensitivity Analysis

해당 실험은 loss의 가중치에 대한 분석 결과로, DCI 데이터에서 하나의 파라미터를 분석할 때 다른 파라미터는 최적치로 고정하여 실험한 결과입니다. \lambda_r=0.8, \lambda_f = 0.8, \lambda_g=1.0이 각 파라미터의 최적치입니다.
실험 결과 relation loss와 focus loss의 가중치는 성능에 비교적 큰 영향을 주었으며, 둘 다 0.8에서 가장 좋은 결과를 보여주었습니다. 또한, 두 loss 모두 0으로 설정될 경우 retrieval 저하되므로 세밀한 관계 정렬 및 오류 판단 능력이 중요함을 확인할 수 있었다고 합니다. 반면 global loss의 가중치는 0.8~1.2 범위에서 성능이 거의 유지되어 상대적으로 덜 민감한 결과를 보였다고 합니다.
Conclusion
저자들은 long-text retrieval에서 발생하는 fine-grained alignment와 factual disproving의 한계를 해결하기 위해 POGA라는 새로운 프레임워크를 제안합니다. POGA는 MSGA 모듈을 통해 동일 의미의 표현만 다른 paraphrased positive와 사실 정보를 의도적으로 변경한 counterfactual negative, 구조화된 graph를 생성하며, HMA 프레임워크를 통해 global/node/relation/focal disproving 4가지에 대한 복합적인 손실 함수를 통해 정밀한 alignment를 수행하도록 학습됩니다. 이후 POGA는 다양한 벤치마크 및 실험을 통해 효과를 입증하였습니다.
RRM 모듈 및 Disproving 능력에 대한 평가가 따로 이루어지지 않은 것이 아쉽습니다. 강력히 주장한 내용 중 하나가 counterfactual 정보를 이해하고 어디가 잘못된 것인지 예측하는 모듈임에도 이에 대해 실험에서는 다루고 있지 않습니다.
안녕하세요 승현님 좋은리뷰 감사합니다
저도 이번에 리뷰한 논문이 모델이 전체적인 맥락은 맞게 이해하더라도 세부적인 오류는 놓칠수 있다는 문제의식인데 비슷한거 같아서 흥미롭게 읽었슴당.
한가지 궁금한 점은 실험에서는 retrieval 성능이 주로 제시되어있는데 이 성능 향상이 실제로 바뀐 속성이나 관계를 식별하는 factual disproving능력에서 온건지 아님 hard negative를 전반적으로 더 잘 분리한 결과인지는 어떻게 구분할수 있을까여?
counterfactual negative가 llm으로 생성된 한 요소만 바뀐 문장이다 보니 실제로 오류를 판별한거라기 보다 문장 패턴이나 규칙 자체를 학습했을 가능성은 없을까여?
예를들어서 txt only나 img shuffle같은 조건에서도 비슷하게 구분된다면 뭔가 factual disproving이라고 보기 어려울 것 같은데 승현님은 이 부분을 어떻게 보셨는지 궁금합니다!
질문 감사합니다.
해당 논문에서는 factual disproving 능력을 학습하기 위해 hard negative (하나의 요소를 변형한 counterfactual negative) 정보를 사용합니다. 여기서는 hard negative를 잘 물리할 수 있다는게 factual disproving능력을 보여주는것이라 생각합니다. 하지만 이에 대해서 실험적으로 보이지는 못하고있는 것 같습니다. 저도 counterfactual negative 케이스에 대한 판단을 추가로 평가했어야 한다고 생각합니다.
말씀하신대로 문장 패턴이나 규칙을 학습했다면 하나의 요소가 바뀐 counterfactual negative에 대해서 판단을 하는 능력이 좋지 못할것이라 생각됩니다. 동일 패턴인데 요소가 바뀌어 의미가 달라진 경우 이를 구분할 수 있도록 하는 게 factual disproving 능력이라 이해하였습니다.