Recent Posts
[ICCV 2023] Sigmoid Loss for Language Image Pre-Training
Prologue 안녕하세요. 강희승입니다. 이번에는 SigLIP입니다. 기초교육 간 읽은 논문 중 최대한 X-review에 작성되지 않은 논문들을 리뷰해보려고 합니다. SigLIP도 최근 자주 쓰이는 Visual Backbone으로 알고 있는데,…
[arXiv 2026] Emotion-LLaMAv2 and MMEVerse – A New Framework and Benchmark for Multimodal Emotion Understanding
안녕하세요. 이번에는 Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding 논문을 읽어봤습니다. Emotion-LLaMA라는 emotion reasoning 분야로 획을 그은 논문의 후속 논문인데요….
[CVPR 2025] VGGT: Visual Geometry Grounded Transformer
안녕하세요. 오늘 리뷰할 논문은 CVPR 2025에서 Best Paper Award를 받은 VGGT(Visual Geometry Grounded Transformer)입니다. Introduction 본 논문은 3D reconstruction task를 다루고 있습니다. 3D reconstruction은 기본적으로…
[CVPR 2026] Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
1. Introduction Qwen-VL이나 LLaVA와 같은 Vision-Language Model(VLM)은 이미지를 이해하고, 이미지에 대한 질문에 답하거나 복잡한 시각적 추론을 수행하는 등 다양한 vision-language task에서 좋은 성능을 보여주고 있습니다….
[2026 ECCV] Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision Language Models
안녕하세요! 최근 VLM들은 이미지의 전반적인 내용은 꽤 잘 이해하지만, 막상 아주 작은 디테일을 확인하거나 이미지의 여러 위치에 흩어진 정보를 함께 봐야 하는 문제에서는 여전히 어려움을…
[EMNLP 2022] Why is Winoground Hard? Investigating Failures in Visuolinguistic Compositionality
오늘은 다소 오래된 논문을 하나 리뷰해보려고 합니다. 최근 Winoground 데이터셋을 활용해 간단한 feasibility 실험을 진행했는데, 예상보다 성능이 상당히 저조했습니다. 마침 이러한 Winoground의 낮은 성능이 어디에서…
[ICCV2025] VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior
[Intro 오늘 소개드릴 논문은 물리적으로 그럴듯해 보이는 영상을 만들기 위한 해결책을 제시하는 논문입니다. 최근 ai 영상 생성은 크게 인기를 끌 고 있으며 video diffusion models(VDMs)은…
[ICLR 2025] MLLMS KNOW WHERE TO LOOK: TRAINING-FREE PERCEPTION OF SMALL VISUAL DETAILS WITH MULTIMODAL LLMS
안녕하세요 오늘은 MLLM이 작은 글자나 숫자 같은 세부 정보를 잘 읽지는 못하지만, 의외로 어디를 봐야 하는지는 알고 있을 수 있다! 라는 주장을 하는 논문을 가져왔습니다!논문의…
[AAAI 2026] Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation
안녕하세요, 이번에는 Long-Term Anticipation 관련 논문을 가지고 왔습니다. 다음 학기에 어떤 주제를 잡아야 할 지에 대한 고민이 아직 있어서 약간의 찍먹 차원으로 읽어보게 되었습니다. Introduction…
[RSS 2025] π0: A Vision-Language-Action Flow Model for General Robot Control
안녕하세요. 이번에 가져온 논문은 π 시리즈의 첫 논문인 π0를 가져왔습니다. 꾸준히 발전되어 π0.7까지 나온 것 같은데, 이런 최신 논문을 따라가기 위해 첫 논문을 자세히 읽어보자는…
네 맞습니다. 실제로 초기에 나온 답의 토큰이 이후 remasking을 통해 수정될 수도 있습니다. 하지만 제 경험상 답이 토큰이 생성된 후에…