Author: 황 찬미
[2025 ICLR] SEE WHAT YOU ARE TOLD: VISUAL ATTENTION SINK IN LARGE MULTIMODAL MODELS
안녕하세요 오늘은 ICLR 2025에 게재된 See What You Are Told: Visual Attention Sink in Large Multimodal Models 라는 논문을 보려 합니다. 간단하게 말하자면, LMM에서 실제로는…
2026 상반기 회고
안녕하세요 황찬미 입니다. 어느덧 벌써 2026년의 절반이나 지났네요! 매번 시간이 참 빠르다고 생각하는데 이번 상반기는 개인적으로 유독 더 빨랐던 것 같습니다. [2026년 상반기를 보내며] 작년…
[2026 ECCV] Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision Language Models
안녕하세요! 최근 VLM들은 이미지의 전반적인 내용은 꽤 잘 이해하지만, 막상 아주 작은 디테일을 확인하거나 이미지의 여러 위치에 흩어진 정보를 함께 봐야 하는 문제에서는 여전히 어려움을…
[ICLR 2025] MLLMS KNOW WHERE TO LOOK: TRAINING-FREE PERCEPTION OF SMALL VISUAL DETAILS WITH MULTIMODAL LLMS
안녕하세요 오늘은 MLLM이 작은 글자나 숫자 같은 세부 정보를 잘 읽지는 못하지만, 의외로 어디를 봐야 하는지는 알고 있을 수 있다! 라는 주장을 하는 논문을 가져왔습니다!논문의…
[ICML 2026] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
안녕하세요오늘은 ICML2026에 억셉된 논문이자 ICML참관했을때 주의깊게 봤던 포스터였던 논문인 Zooming without Zooming 논문을 리뷰해보겠습니다.들어가기에 앞서 간략하게 설명하자면 추론 과정에서 이미지의 작은 영역을 반복적으로 크롭하고 확대하는…
ICML 2026 참관기
안녕하세요 ! 이번주는 서울 코엑스에서 열린 ICML 2026에 7월7일부터 7월9일까지 3일간 참석한 참관기를 작성해보았습니다! ICML이 ML분야의 대표적인 국제학회인 만큼 최신 연구를 직접 눈으로 보고, 멋진…
[CVPR 2026] FINER: MLLMs Hallucinate under Fine-grained Negative Queries
안녕하세요 오늘은 MLLM의 fine grained hallucination과 관련된 FINER논문을 읽어봤습니다CVPR 2026 oral논문이고 MLLM 모델이 이미지 속의 시각적인 정보와 텍스트를 real로 세밀하게 맞춰 보고 있는지! 라는 문제의식이…
[NeurIPS 2025] FastVID: Dynamic Density Pruning for Fast Video Large Language Models
안녕하세요 오늘은 multimodal token compression관련 논문을 읽어보겠습니다. Intro 최근의 Video-LLM은 video understanding에서 좋은 성능을 보여주고 있습니다. 하지만 비디오는 여러 프레임으로 구성되어 있고 또 각 프레임마다…
[CVPR 2026] DIvide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
안녕하세요.오늘은 long video understanding을 수행할 때, 모든 query에 대해 같은 방식으로 프레임을 샘플링하는 것이 아니라 query type에 따라 적절한 frame selection strategy를 다르게 적용하는 방법을…
[CVPR 2026] Think, Then Verify: A Hypothesis–Verification Multi-Agent Framework for Long Video Understanding
안녕하세요. 오늘은 long video understanding 분야의 논문 중 긴 비디오를 무작정 탐색하는 대신 정답 선지에 대한 가설을 먼저 세운 뒤 영상의 증거로 검증하는 방식을 제안한…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…