Author: 이 승현
[NeurIPS 2026]GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
Abstract Fine-Grained Open-vocabulary object detection(FG-OVD)은 새로운 카테고리에 대한 묘사를 기반으로 물체를 탐지하는 것을 목표로 합니다. 기존의 open-vocabulary detection이 베이스 카테고리에서는 그럴듯한 성능을 보였으나, fine-grained 세팅에서는…
2026년 상반기 회고 – 이승현
벌써 올해의 반이 지나가서 상반기 회고를 쓰고있네요. 연초에 올해는 꼭!! 이런 마인드로 계획을 세웠던 것 같은데, 연초 목표와 비교해보았을 때 달성하지 못한 내용이 많은 것…
[AAAI 2026] Endowing Vision-Language Models with System 2 Thinking for Fine-Grained Visual Recognition
Abstract VLMs는 query 이미지에서 주요한 시각적 특징을 추출하는 능력이 뛰어나지만, fine-grained 시나리오에서는 미묘한 차이를 식별하는 데 어려움을 겪습니다. 저자들은 인간의 “System 1 & System 2”…
[NeurIPS 2025]VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning
Abstract few-shot learning은 Few-shot의 labeled support 데이터를 통해 새로운 개념을 인식하는 것을 목표로 하며, 최근 연구들은 클래스에 대한 description과 같은 추가적인 정보를 통합하는 방식으로 연구가…
[CVPR2025] ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
Abstrcat 대규모 이미지-텍스트 데이터로 학습된 VLM은 classification에서 상당한 개선을 이루었으나, 모델의 성능이 프롬프트 품질에 의존하게 됩니다. 최근 연구들은 LLM이 생성한 시각적 설명이 VLM의 일반화 능력을…
[CVPR 2026]SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names
Abstract OVD는 임의의 텍스트로 설명되는 객체 탐지를 목표로 하지만, 대부분 coarse한 수준에서 동작하며, 세밀한 속성에는 동작하는 데 어려움을 겪습니다. 해당 논문은 모델과 데이터 두 관점에서…
[ICLR 2026] DiVE-k: Differential Visual Reasoning for Fine-Grained Image Recognition
Abstract LVML은 방대한 text 지식을 보유하고 있으나, 이를 fine-grained image recognition에 적용하기에는 어려움 겪고있으며, 시각적으로 유사한 카테고리를 구분하지 못하는 경우가 많습니다. 정확한 문자열이 일치할 경우…
[CVPR 2026] POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval
Abstract retrieval에서 embedding 생성에 사용되는 대부분의 모델은 다른 목적으로 학습이 되다 보니 물체의 세부 속성보다 coarse한 물체에 집중하는 경향이 있습니다. 또한, 서로 다른 description을 구분하는…
[CVPR 2025] FineLIP: Extending CLIP’s Reach via Fine-Grained Alignment with Longer Text Inputs
Abstract CLIP이 다양한 분야에서 성공적으로 적용이 되고있으나, 기존의 CLIP은 77 token이라는 한정된 숫자의 text를 처리할 수 있으며, 디테일한 시각·언어 정보를 파악하는 데는 어려움이 있다고 알려져있습니다….
[CVPR 2026(Highlight)]CLIP Is Shortsighted: Paying Attention Beyond the First Sentence
Abstract CLIP은 두드러지는 객체에 대한 단순한 설명을 인코딩하도록 학습되었으며, 이로 인해 복잡한 장면이나 밀도 높은 description에 대해서는 이미지와 텍스트 사이의 정력이 잘 맞지 않는 문제가…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…