Author: 신 인택
[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space
안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….
[ICCV 2025] Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation
이전 연구주제에서 이제 새로운 연구주제를 서베이 하면서 이것저것 읽어보다가 간단하게 리뷰해볼만 task를 찾아서 리뷰하게 되었습니다. 이번에 리뷰할 논문은 VLM의 perspective-aware spatial reasoning, 그중에서도 Allocentric spatial…
2026년 상반기 회고 – 신인택
상반기 회고록을 작성하기 앞서서, 교수님께서 개별, 팀별의 목표를 연초에 작성하도록 하셨는데, 해당 목표로부터 얼마나 지켜지고 있는지 얘기하고, 연구실 생활을 얘기하며 글을 마치고자 합니다. [상반기 목표]…
[CVPR 2026] One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs
안녕하세요 이번에는 최근 token compression 논문들중 update 된 애들이 있나 살펴보고 찾은 논문입니다. 그럼 리뷰 시작하겠습니다. Abstract 우선 이 논문은 LVLM에서 visual token pruning을 layer별로…
ICML 2026 참관기
안녕하세요 이번 X-diary로는 26년도 코엑스에서 열린 ICML 학회 참관기를 작성하려고 합니다.이번 ICML 학회가 코엑스에서 열리게 되어 부담없이 즐길 수 있을 줄 알았지만 방대한 양의 포스터와…
[ICML 2026] Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation
안녕하세요 이번에는 ICML 학회에 다녀오게 되면서 보게 된 포스터 논문 중 제가 연구하고 있는 분야와 동일 분야를 연구하고 있던 논문이 있어서 가져왔습니다. 기존에 VQA task…
[AAAI 2026] Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
Abstract LVLMs 들은 visual 입력들을 dense 한 sequences 들의 패치들로 변환하여 미세한 semantics들을 포착한다고 합니다. 이러한 visual tokens 들은 textual tokens 들과 달리 토큰수가 많고…
[Arxiv 2022] Exploring Visual Explanations for Contrastive Language-Image Pre-training
안녕하세요 이번에 들고온 논문은 CLIP 의 Vision 과 Text embedding의 similarity map 이 기대하는 경향성과는 반대라는점을 밝히고 개선한 논문입니다. Abstract 우선 저자는 Contrastive Language-Image Pre-training,…
[NeurIPS 2025] Don’t Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention
안녕하세요 이번에 들고온 논문도 마찬가지로 VLM 에서의 Token pruning 논문입니다. Abstract 대형 Vision-Language Models (LVLMs) 는 일반적으로 텍스트 토큰보다 훨씬 많은 수의 시각 토큰을 포함하고…
[ICLR 2026] AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
안녕하세요 이번에 들고온 논문도 VLM 에서의 token pruning 논문입니다. 제가 분석하고있는 방법론과 비슷한 방법을 사용하고, 기존 방법론들이 성능 올리고 어거지로 주장하는 느낌보다는 분석적인 내용도 깔끔하고…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…