Author: 홍 주영

Posted in X-Review

[ECCV 2026] What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

최근 집중해서 보고있는 주제인 Composition의 원인을 VLM의 layer 별로 분석한 연구입니다. ECCV Oral 로 선정되었습니다 1. CLIP은 not을 이해하지 못한다? 다들 아시겠지만, CLIP과 같은 Vision-Language…

Continue Reading
Posted in Ph.D. X-Diary

2026년 상반기 회고 – 홍주영

들어가며 벌써 2026년의 절반이 지나갔습니다. 작년 회고에서 저는 스스로를 ‘시동이 오래 걸리는 사람’이라고 적었던 기억이 납니다. 연구에 한번 빠지면 그것만 계속 생각하는 편인데, 정작 그…

Continue Reading
Posted in Conference X-Review

[CVPR 2025] Assessing and Learning Alignment of Unimodal Vision and Language Models

오늘은 조금 흥미로운 논문이 있어 읽어보았습니다. 많은 논문들이 택하는 CLIP에 DINOv2를 보조적으로 붙이는 방식에서 벗어나, DINOv2 자체를 Language space와 직접, 그리고 매우 효율적으로 정렬하는 방법을…

Continue Reading
Posted in X-Review

[ICLR 2026] Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training

이번에 리뷰하려는 페이퍼는 텍스트로만 학습된 LLM이 이미지를 전혀 보지 않고도 시각적 사전 지식인 Visual Priors 를 이미 가지고 있다는 것을 밝힌 논문입니다. 1. 이미지 없이,…

Continue Reading
Posted in X-Review

[EMNLP 2022] Why is Winoground Hard? Investigating Failures in Visuolinguistic Compositionality

오늘은 다소 오래된 논문을 하나 리뷰해보려고 합니다. 최근 Winoground 데이터셋을 활용해 간단한 feasibility 실험을 진행했는데, 예상보다 성능이 상당히 저조했습니다. 마침 이러한 Winoground의 낮은 성능이 어디에서…

Continue Reading
Posted in X-Review

[NeurIPS 2024] SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations

저는 최근 VLM의 일반화 능력에 관한 논문을 보면서, 막연하게 “VLM은 유의어나 서로 다른 표현을 같은 의미로 이해할 수 있을까?”라는 의문을 가지고 있었습니다. 이러한 의문이 들었던…

Continue Reading
Posted in X-Review

[ICML 2026] Adaptive Token Refinement in Long-Tailed Large Vision-Language Models Fine-Tuning

대부분의 모델이 가지는 long-tailed 문제를 해결하려고 한 ICML 논문에 대해 리뷰해보겠습니다. Venue: ICML 2026Authors: Wenjun Miao, Mingda Li, Yanchao Hao, Zheng WeiAffiliation: Beihang University (Beijing), Tencent…

Continue Reading
Posted in X-Diary

ICML 2026 참관기

코엑스에서 열린 ICML 2026에 참석한 후기를 작성해보겠습니다. https://youtu.be/RUvbfNvj3Lk인상깊게 봤던 페이퍼에 대한 세미나는 위에 링크에 걸어두었습니다. 그리고 살펴봤던 페이퍼는 제가 개인적으로 정리해두기도 했고, 발표로도 다뤄봤으니…다이어리에는 학회에…

Continue Reading
Posted in X-Review

[ICML 2026] Are Object-Centric Representations Better At Compositional Generalization?

오늘은 object-centric representation이 정말로 composition 능력에 강인한가? 에 대해 분석한 논문을 리뷰해보겠습니다. Venue: ICML 2026 Authors: Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik…

Continue Reading
Posted in X-Review

Protected: [Peer Review] Text-Conditioned Static-Dynamic Composition for Composed Video Retrieval

There is no excerpt because this is a protected post.

Continue Reading