Author: 황 찬미

Posted in Paper X-Review

[2025 ICLR] SEE WHAT YOU ARE TOLD: VISUAL ATTENTION SINK IN LARGE MULTIMODAL MODELS

안녕하세요 오늘은 ICLR 2025에 게재된 See What You Are Told: Visual Attention Sink in Large Multimodal Models 라는 논문을 보려 합니다. 간단하게 말하자면, LMM에서 실제로는…

Continue Reading
Posted in M.S. X-Diary

2026 상반기 회고

안녕하세요 황찬미 입니다. 어느덧 벌써 2026년의 절반이나 지났네요! 매번 시간이 참 빠르다고 생각하는데 이번 상반기는 개인적으로 유독 더 빨랐던 것 같습니다. [2026년 상반기를 보내며] 작년…

Continue Reading
Posted in Paper X-Review

[2026 ECCV] Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision Language Models

안녕하세요! 최근 VLM들은 이미지의 전반적인 내용은 꽤 잘 이해하지만, 막상 아주 작은 디테일을 확인하거나 이미지의 여러 위치에 흩어진 정보를 함께 봐야 하는 문제에서는 여전히 어려움을…

Continue Reading
Posted in Paper X-Review

[ICLR 2025] MLLMS KNOW WHERE TO LOOK: TRAINING-FREE PERCEPTION OF SMALL VISUAL DETAILS WITH MULTIMODAL LLMS

안녕하세요 오늘은 MLLM이 작은 글자나 숫자 같은 세부 정보를 잘 읽지는 못하지만, 의외로 어디를 봐야 하는지는 알고 있을 수 있다! 라는 주장을 하는 논문을 가져왔습니다!논문의…

Continue Reading
Posted in Paper X-Review

[ICML 2026] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

안녕하세요오늘은 ICML2026에 억셉된 논문이자 ICML참관했을때 주의깊게 봤던 포스터였던 논문인 Zooming without Zooming 논문을 리뷰해보겠습니다.들어가기에 앞서 간략하게 설명하자면 추론 과정에서 이미지의 작은 영역을 반복적으로 크롭하고 확대하는…

Continue Reading
Posted in M.S. X-Diary

ICML 2026 참관기

안녕하세요 ! 이번주는 서울 코엑스에서 열린 ICML 2026에 7월7일부터 7월9일까지 3일간 참석한 참관기를 작성해보았습니다! ICML이 ML분야의 대표적인 국제학회인 만큼 최신 연구를 직접 눈으로 보고, 멋진…

Continue Reading
Posted in Paper X-Review

[CVPR 2026] FINER: MLLMs Hallucinate under Fine-grained Negative Queries

안녕하세요 오늘은 MLLM의 fine grained hallucination과 관련된 FINER논문을 읽어봤습니다CVPR 2026 oral논문이고 MLLM 모델이 이미지 속의 시각적인 정보와 텍스트를 real로 세밀하게 맞춰 보고 있는지! 라는 문제의식이…

Continue Reading
Posted in Paper X-Review

[NeurIPS 2025] FastVID: Dynamic Density Pruning for Fast Video Large Language Models

안녕하세요 오늘은 multimodal token compression관련 논문을 읽어보겠습니다. Intro 최근의 Video-LLM은 video understanding에서 좋은 성능을 보여주고 있습니다. 하지만 비디오는 여러 프레임으로 구성되어 있고 또 각 프레임마다…

Continue Reading
Posted in Paper X-Review

[CVPR 2026] DIvide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

안녕하세요.오늘은 long video understanding을 수행할 때, 모든 query에 대해 같은 방식으로 프레임을 샘플링하는 것이 아니라 query type에 따라 적절한 frame selection strategy를 다르게 적용하는 방법을…

Continue Reading
Posted in Paper X-Review

[CVPR 2026] Think, Then Verify: A Hypothesis–Verification Multi-Agent Framework for Long Video Understanding

안녕하세요. 오늘은 long video understanding 분야의 논문 중 긴 비디오를 무작정 탐색하는 대신 정답 선지에 대한 가설을 먼저 세운 뒤 영상의 증거로 검증하는 방식을 제안한…

Continue Reading