Author: 황 찬미
[ICML 2026] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
안녕하세요오늘은 ICML2026에 억셉된 논문이자 ICML참관했을때 주의깊게 봤던 포스터였던 논문인 Zooming without Zooming 논문을 리뷰해보겠습니다.들어가기에 앞서 간략하게 설명하자면 추론 과정에서 이미지의 작은 영역을 반복적으로 크롭하고 확대하는…
ICML 2026 참관기
안녕하세요 ! 이번주는 서울 코엑스에서 열린 ICML 2026에 7월7일부터 7월9일까지 3일간 참석한 참관기를 작성해보았습니다! ICML이 ML분야의 대표적인 국제학회인 만큼 최신 연구를 직접 눈으로 보고, 멋진…
[CVPR 2026] FINER: MLLMs Hallucinate under Fine-grained Negative Queries
안녕하세요 오늘은 MLLM의 fine grained hallucination과 관련된 FINER논문을 읽어봤습니다CVPR 2026 oral논문이고 MLLM 모델이 이미지 속의 시각적인 정보와 텍스트를 real로 세밀하게 맞춰 보고 있는지! 라는 문제의식이…
[NeurIPS 2025] FastVID: Dynamic Density Pruning for Fast Video Large Language Models
안녕하세요 오늘은 multimodal token compression관련 논문을 읽어보겠습니다. Intro 최근의 Video-LLM은 video understanding에서 좋은 성능을 보여주고 있습니다. 하지만 비디오는 여러 프레임으로 구성되어 있고 또 각 프레임마다…
[CVPR 2026] DIvide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
안녕하세요.오늘은 long video understanding을 수행할 때, 모든 query에 대해 같은 방식으로 프레임을 샘플링하는 것이 아니라 query type에 따라 적절한 frame selection strategy를 다르게 적용하는 방법을…
[CVPR 2026] Think, Then Verify: A Hypothesis–Verification Multi-Agent Framework for Long Video Understanding
안녕하세요. 오늘은 long video understanding 분야의 논문 중 긴 비디오를 무작정 탐색하는 대신 정답 선지에 대한 가설을 먼저 세운 뒤 영상의 증거로 검증하는 방식을 제안한…
[CVPR 2026] VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
안녕하세요 오늘은 CVPR 2026에 accept된 video understanding 연구를 리뷰해보겠습니다.요즘 저는 적은 프레임, 작은 모델을 사용하면서도 성능은 어느 정도 나오는 효율적인 프레임워크들을 관심있게 보고 있는데요! 이…
[ICCV 2023] Adding Conditional Control to Text-to-Image Diffusion Models
안녕하세요!오늘은 지난주에 이어 stable diffusion 기반 이미지 생성에서 구조적인 조건을 효과적으로 반영할 수 있게 해주는 대표적인 네트워크인 ControlNet에 대해 리뷰해보겠습니다! 그럼 리뷰 바로 시작하겠습니다! Intro…
[CVPR 2022] High-Resolution Image Synthesis with Latent Diffusion Models
안녕하세요! 이번에 리뷰할 논문은 Stable Diffusion의 근간이 되는 Latent Diffusion Model(LDM)논문입니다! 최근에 디퓨전 모델을 서베이 하면서 거슬러 거슬러 올라가 stable diffusion의 토대인 모델을 읽어보게 되었는데요….
[WACV 2026] ReFineVQA: Iterative Refinement of Video Description via Feedback Generation for Video Question Answering
안녕하세요 오늘은 RefineVQA논문을 리뷰하겠습니다.이 논문은 VideoQA에서 질문에 맞는 비디오 설명을 반복적으로 보완해 더 정확한 답을 생성하도록 하는 방법을 제안한 연구입니다! 리뷰 시작하겠습니다. Intro 이 논문은…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…