Category: Paper
Paper Review
[NeurIPS 2025] Don’t Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention
안녕하세요 이번에 들고온 논문도 마찬가지로 VLM 에서의 Token pruning 논문입니다. Abstract 대형 Vision-Language Models (LVLMs) 는 일반적으로 텍스트 토큰보다 훨씬 많은 수의 시각 토큰을 포함하고…
[ICLR 2026] UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
안녕하세요. 이번에 리뷰로 가져온 논문은 ICLR 2026에 게재된 UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos라는 논문입니다. 이 논문은 제목 그대로 city-tour video 도시 투어…
[NeurIPS 2025] FastVID: Dynamic Density Pruning for Fast Video Large Language Models
안녕하세요 오늘은 multimodal token compression관련 논문을 읽어보겠습니다. Intro 최근의 Video-LLM은 video understanding에서 좋은 성능을 보여주고 있습니다. 하지만 비디오는 여러 프레임으로 구성되어 있고 또 각 프레임마다…
[ICML 2026] VideoBrain : Learning Adaptive Frame Sampling for Long Video Understanding
안녕하세요, 요즘 SAR만 파다 보니 루즈해지기도 해서 마침 ICML conference 참가 신청도 했겠다 어떤 논문들이 있는지 찾아보았는데, adaptive frame sampling이라는 말에 끌려 이 논문을 읽어보게…
[ICLR 2026] AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
안녕하세요 이번에 들고온 논문도 VLM 에서의 token pruning 논문입니다. 제가 분석하고있는 방법론과 비슷한 방법을 사용하고, 기존 방법론들이 성능 올리고 어거지로 주장하는 느낌보다는 분석적인 내용도 깔끔하고…
[arXiv 2026] Zero-shot World Models Are Developmentally Efficient Learners
안녕하세요 오늘은 월드 모델을 가지고 왔습니다. 근데 그냥 월드 모델이 아니라 Zero-shot World Model이라고 해서 어떤 부분에서 Zero-shot이고 어디에 쓸 수 있는지 궁금해서 좀 들고…
[CVPR 2026] DIvide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
안녕하세요.오늘은 long video understanding을 수행할 때, 모든 query에 대해 같은 방식으로 프레임을 샘플링하는 것이 아니라 query type에 따라 적절한 frame selection strategy를 다르게 적용하는 방법을…
[ICLR 2026] PRUNE REDUNDANCY, PRESERVE ESSENCE: VISION TOKEN COMPRESSION IN VLMS VIA SYNERGISTIC IMPORTANCE-DIVERSITY
안녕하세요 이번에 들고온 논문도 VLM 에서의 token pruning 논문입니다. 제가 분석하고있는 방법론과 비슷한 키워드로 검색되어 찾아본 논문으로 아이디어를 확인하고자 읽게되었습니다. 바로 리뷰 시작하겠습니다. Abstract VLM들은…
[CVPR 2026] WANDERLAND: Geometrically Grounded Simulation for Open-World Embodied AI
안녕하세요. 이번에 리뷰로 가져온 논문은 CVPR 2026 highlight 논문인 WANDERLAND: Geometrically Grounded Simulation for Open-World Embodied AI라는 논문입니다. 이 논문은 최근 embodied AI나 visual navigation…
[ICLR 2026] VisionTrim: Unified Vision Token Compression forTraining-Free MLLM Acceleration
안녕하세요 이번에 들고온 논문도 VLM 에서의 token pruning 논문입니다. 바로 리뷰 시작하겠습니다. Abstract MLLMs 의 token pruning 논문들에서 단골로 등장하는 말인 입력 단에서의 visual token개수가…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…