Author: 신 인택

Posted in Paper X-Review

[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space

안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….

Continue Reading
Posted in Paper X-Review

[ICCV 2025] Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation

이전 연구주제에서 이제 새로운 연구주제를 서베이 하면서 이것저것 읽어보다가 간단하게 리뷰해볼만 task를 찾아서 리뷰하게 되었습니다. 이번에 리뷰할 논문은 VLM의 perspective-aware spatial reasoning, 그중에서도 Allocentric spatial…

Continue Reading
Posted in M.S. X-Diary

2026년 상반기 회고 – 신인택

상반기 회고록을 작성하기 앞서서, 교수님께서 개별, 팀별의 목표를 연초에 작성하도록 하셨는데, 해당 목표로부터 얼마나 지켜지고 있는지 얘기하고, 연구실 생활을 얘기하며 글을 마치고자 합니다. [상반기 목표]…

Continue Reading
Posted in Paper X-Review

[CVPR 2026] One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

안녕하세요 이번에는 최근 token compression 논문들중 update 된 애들이 있나 살펴보고 찾은 논문입니다. 그럼 리뷰 시작하겠습니다. Abstract 우선 이 논문은 LVLM에서 visual token pruning을 layer별로…

Continue Reading
Posted in X-Diary

ICML 2026 참관기

안녕하세요 이번 X-diary로는 26년도 코엑스에서 열린 ICML 학회 참관기를 작성하려고 합니다.이번 ICML 학회가 코엑스에서 열리게 되어 부담없이 즐길 수 있을 줄 알았지만 방대한 양의 포스터와…

Continue Reading
Posted in Paper X-Review

[ICML 2026] Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation

안녕하세요 이번에는 ICML 학회에 다녀오게 되면서 보게 된 포스터 논문 중 제가 연구하고 있는 분야와 동일 분야를 연구하고 있던 논문이 있어서 가져왔습니다. 기존에 VQA task…

Continue Reading
Posted in Paper X-Review

[AAAI 2026] Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment

Abstract LVLMs 들은 visual 입력들을 dense 한 sequences 들의 패치들로 변환하여 미세한 semantics들을 포착한다고 합니다. 이러한 visual tokens 들은 textual tokens 들과 달리 토큰수가 많고…

Continue Reading
Posted in Paper X-Review

[Arxiv 2022] Exploring Visual Explanations for Contrastive Language-Image Pre-training

안녕하세요 이번에 들고온 논문은 CLIP 의 Vision 과 Text embedding의 similarity map 이 기대하는 경향성과는 반대라는점을 밝히고 개선한 논문입니다. Abstract 우선 저자는 Contrastive Language-Image Pre-training,…

Continue Reading
Posted in Paper X-Review

[NeurIPS 2025] Don’t Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention

안녕하세요 이번에 들고온 논문도 마찬가지로 VLM 에서의 Token pruning 논문입니다. Abstract 대형 Vision-Language Models (LVLMs) 는 일반적으로 텍스트 토큰보다 훨씬 많은 수의 시각 토큰을 포함하고…

Continue Reading
Posted in Paper X-Review

[ICLR 2026] AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

안녕하세요 이번에 들고온 논문도 VLM 에서의 token pruning 논문입니다. 제가 분석하고있는 방법론과 비슷한 방법을 사용하고, 기존 방법론들이 성능 올리고 어거지로 주장하는 느낌보다는 분석적인 내용도 깔끔하고…

Continue Reading