Author: 이 승현

Posted in X-Review

[NeurIPS 2026]GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection

Abstract Fine-Grained Open-vocabulary object detection(FG-OVD)은 새로운 카테고리에 대한 묘사를 기반으로 물체를 탐지하는 것을 목표로 합니다. 기존의 open-vocabulary detection이 베이스 카테고리에서는 그럴듯한 성능을 보였으나, fine-grained 세팅에서는…

Continue Reading
Posted in X-Diary

2026년 상반기 회고 – 이승현

벌써 올해의 반이 지나가서 상반기 회고를 쓰고있네요. 연초에 올해는 꼭!! 이런 마인드로 계획을 세웠던 것 같은데, 연초 목표와 비교해보았을 때 달성하지 못한 내용이 많은 것…

Continue Reading
Posted in X-Review

[AAAI 2026] Endowing Vision-Language Models with System 2 Thinking for Fine-Grained Visual Recognition

Abstract VLMs는 query 이미지에서 주요한 시각적 특징을 추출하는 능력이 뛰어나지만, fine-grained 시나리오에서는 미묘한 차이를 식별하는 데 어려움을 겪습니다. 저자들은 인간의 “System 1 & System 2”…

Continue Reading
Posted in X-Review

[NeurIPS 2025]VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning

Abstract few-shot learning은 Few-shot의 labeled support 데이터를 통해 새로운 개념을 인식하는 것을 목표로 하며, 최근 연구들은 클래스에 대한 description과 같은 추가적인 정보를 통합하는 방식으로 연구가…

Continue Reading
Posted in X-Review

[CVPR2025] ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

Abstrcat 대규모 이미지-텍스트 데이터로 학습된 VLM은 classification에서 상당한 개선을 이루었으나, 모델의 성능이 프롬프트 품질에 의존하게 됩니다. 최근 연구들은 LLM이 생성한 시각적 설명이 VLM의 일반화 능력을…

Continue Reading
Posted in X-Review

[CVPR 2026]SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names

Abstract OVD는 임의의 텍스트로 설명되는 객체 탐지를 목표로 하지만, 대부분 coarse한 수준에서 동작하며, 세밀한 속성에는 동작하는 데 어려움을 겪습니다. 해당 논문은 모델과 데이터 두 관점에서…

Continue Reading
Posted in X-Review

[ICLR 2026] DiVE-k: Differential Visual Reasoning for Fine-Grained Image Recognition

Abstract LVML은 방대한 text 지식을 보유하고 있으나, 이를 fine-grained image recognition에 적용하기에는 어려움 겪고있으며, 시각적으로 유사한 카테고리를 구분하지 못하는 경우가 많습니다. 정확한 문자열이 일치할 경우…

Continue Reading
Posted in X-Review

[CVPR 2026] POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval

Abstract retrieval에서 embedding 생성에 사용되는 대부분의 모델은 다른 목적으로 학습이 되다 보니 물체의 세부 속성보다 coarse한 물체에 집중하는 경향이 있습니다. 또한, 서로 다른 description을 구분하는…

Continue Reading
Posted in X-Review

[CVPR 2025] FineLIP: Extending CLIP’s Reach via Fine-Grained Alignment with Longer Text Inputs

Abstract CLIP이 다양한 분야에서 성공적으로 적용이 되고있으나, 기존의 CLIP은 77 token이라는 한정된 숫자의 text를 처리할 수 있으며, 디테일한 시각·언어 정보를 파악하는 데는 어려움이 있다고 알려져있습니다….

Continue Reading
Posted in X-Review

[CVPR 2026(Highlight)]CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

Abstract CLIP은 두드러지는 객체에 대한 단순한 설명을 인코딩하도록 학습되었으며, 이로 인해 복잡한 장면이나 밀도 높은 description에 대해서는 이미지와 텍스트 사이의 정력이 잘 맞지 않는 문제가…

Continue Reading