Posted in Paper X-Review

[2026 ECCV] Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision Language Models

안녕하세요! 최근 VLM들은 이미지의 전반적인 내용은 꽤 잘 이해하지만, 막상 아주 작은 디테일을 확인하거나 이미지의 여러 위치에 흩어진 정보를 함께 봐야 하는 문제에서는 여전히 어려움을…

Continue Reading
Posted in X-Review

[EMNLP 2022] Why is Winoground Hard? Investigating Failures in Visuolinguistic Compositionality

오늘은 다소 오래된 논문을 하나 리뷰해보려고 합니다. 최근 Winoground 데이터셋을 활용해 간단한 feasibility 실험을 진행했는데, 예상보다 성능이 상당히 저조했습니다. 마침 이러한 Winoground의 낮은 성능이 어디에서…

Continue Reading
Posted in X-Review

[ICCV2025] VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior

[Intro 오늘 소개드릴 논문은 물리적으로 그럴듯해 보이는 영상을 만들기 위한 해결책을 제시하는 논문입니다. 최근 ai 영상 생성은 크게 인기를 끌 고 있으며 video diffusion models(VDMs)은…

Continue Reading
Posted in Paper X-Review

[ICLR 2025] MLLMS KNOW WHERE TO LOOK: TRAINING-FREE PERCEPTION OF SMALL VISUAL DETAILS WITH MULTIMODAL LLMS

안녕하세요 오늘은 MLLM이 작은 글자나 숫자 같은 세부 정보를 잘 읽지는 못하지만, 의외로 어디를 봐야 하는지는 알고 있을 수 있다! 라는 주장을 하는 논문을 가져왔습니다!논문의…

Continue Reading
Posted in X-Review

[AAAI 2026] Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation

안녕하세요, 이번에는 Long-Term Anticipation 관련 논문을 가지고 왔습니다. 다음 학기에 어떤 주제를 잡아야 할 지에 대한 고민이 아직 있어서 약간의 찍먹 차원으로 읽어보게 되었습니다. Introduction…

Continue Reading
Posted in Paper X-Review

[RSS 2025] π0: A Vision-Language-Action Flow Model for General Robot Control

안녕하세요. 이번에 가져온 논문은 π 시리즈의 첫 논문인 π0를 가져왔습니다. 꾸준히 발전되어 π0.7까지 나온 것 같은데, 이런 최신 논문을 따라가기 위해 첫 논문을 자세히 읽어보자는…

Continue Reading
Posted in Paper X-Review

[CVPR 2026] One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

안녕하세요 이번에는 최근 token compression 논문들중 update 된 애들이 있나 살펴보고 찾은 논문입니다. 그럼 리뷰 시작하겠습니다. Abstract 우선 이 논문은 LVLM에서 visual token pruning을 layer별로…

Continue Reading
Posted in Paper X-Review

[ICLR 2022] LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS

Abstract 안녕하세요, 강희승입니다. 오늘 리뷰해볼 논문은 LoRA입니다. LoRA는 해당 분야에서 획기적으로 학습할 파라미터의 수를 줄였고, 일부 파라미터만 fine-tuning함에도 불구하고, Full fine-tuning의 성능에 비해 drop이 크지…

Continue Reading
Posted in X-Review

[ICML 2026] World-Model Inspired Emotion-aware Token Refinement for Training-Free Multimodal Emotion Recognition

안녕하세요. 이번에는 World-Model Inspired Emotion-aware Token Refinement for Training-Free Multimodal Emotion Recognition 논문을 읽어보았습니다. ICML 2026에 실린 논문인데요. 이 논문은 감정 인식 모델을 다시 학습시키지…

Continue Reading
Posted in X-Diary X-Review

ICML 참관기

안녕하세요, 손우진입니다. 조금 시간은 지났지만 코엑스에서 열린 ICML 2026에 다녀와 참관기를 남깁니다. 저번주 세미나를 준비하면서 다시금 상기시켰던 ICML의 기억을담아 작성해보도록 하겠습니다 다들 아시겠지만 학회 첫날…

Continue Reading