Author: 이 승현
[CVPR2025] ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
Abstrcat 대규모 이미지-텍스트 데이터로 학습된 VLM은 classification에서 상당한 개선을 이루었으나, 모델의 성능이 프롬프트 품질에 의존하게 됩니다. 최근 연구들은 LLM이 생성한 시각적 설명이 VLM의 일반화 능력을…
[CVPR 2026]SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names
Abstract OVD는 임의의 텍스트로 설명되는 객체 탐지를 목표로 하지만, 대부분 coarse한 수준에서 동작하며, 세밀한 속성에는 동작하는 데 어려움을 겪습니다. 해당 논문은 모델과 데이터 두 관점에서…
[ICLR 2026] DiVE-k: Differential Visual Reasoning for Fine-Grained Image Recognition
Abstract LVML은 방대한 text 지식을 보유하고 있으나, 이를 fine-grained image recognition에 적용하기에는 어려움 겪고있으며, 시각적으로 유사한 카테고리를 구분하지 못하는 경우가 많습니다. 정확한 문자열이 일치할 경우…
[CVPR 2026] POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval
Abstract retrieval에서 embedding 생성에 사용되는 대부분의 모델은 다른 목적으로 학습이 되다 보니 물체의 세부 속성보다 coarse한 물체에 집중하는 경향이 있습니다. 또한, 서로 다른 description을 구분하는…
[CVPR 2025] FineLIP: Extending CLIP’s Reach via Fine-Grained Alignment with Longer Text Inputs
Abstract CLIP이 다양한 분야에서 성공적으로 적용이 되고있으나, 기존의 CLIP은 77 token이라는 한정된 숫자의 text를 처리할 수 있으며, 디테일한 시각·언어 정보를 파악하는 데는 어려움이 있다고 알려져있습니다….
[CVPR 2026(Highlight)]CLIP Is Shortsighted: Paying Attention Beyond the First Sentence
Abstract CLIP은 두드러지는 객체에 대한 단순한 설명을 인코딩하도록 학습되었으며, 이로 인해 복잡한 장면이나 밀도 높은 description에 대해서는 이미지와 텍스트 사이의 정력이 잘 맞지 않는 문제가…
[CVPR 2026 (Highlight)] V^2-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence
Abstract Cross-view object correspondence는 서로 다른 뷰에서 대응되는 물체를 인식하는 연구로, 시점 및 외관 변화가 심하여 단순히 SAM2와 같은 foundation 모델을 적용하는 것으로는 해결이 어렵습니다….
[CVPR 2026] Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
Abstract Vocabulary-free fine-grained image recognition은 사람이 사전에 정의한 라벨 집합이 없어도, 동일한 meta-class 내부에서 시각적으로 유사한 세부 카테고리를 구분하는 것을 목표로 합니다. 기존 연구들은 사전에…
[CVPR 2026]AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
Abstract 최근 로봇 조작에서 imitation learning을 활용한 연구들이 성공을 이루고 있으나, 제한적인 데이터 다양성으로 인해 기하학적 변형에는 제약이 있습니다. 해당 논문은 3D 생성 모델과 VFMs를…
[arXiv2026] AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation
Abstract 시뮬레이션 기반의 데이터 생성 방식이 로봇 조작 정책 학습의 지배적 흐름이 되었습니다. 그러나 기존의 방식들은 affordance 정보를 trajectory에 포함하지 못하며, 이로 인해 특정 기능이…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…