Category: X-Review
Paper, Conference, Seminar, API, Code, Dataset 등의 리뷰를 담을 예정입니다.
[ICCV 2025] Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation
이전 연구주제에서 이제 새로운 연구주제를 서베이 하면서 이것저것 읽어보다가 간단하게 리뷰해볼만 task를 찾아서 리뷰하게 되었습니다. 이번에 리뷰할 논문은 VLM의 perspective-aware spatial reasoning, 그중에서도 Allocentric spatial…
[NeurIPS 2026]GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
Abstract Fine-Grained Open-vocabulary object detection(FG-OVD)은 새로운 카테고리에 대한 묘사를 기반으로 물체를 탐지하는 것을 목표로 합니다. 기존의 open-vocabulary detection이 베이스 카테고리에서는 그럴듯한 성능을 보였으나, fine-grained 세팅에서는…
[ICML 2026] Global Geometry Is Not Enough for Vision Representations
안녕하세요, 강희승입니다. 지난 방학 동안 기초교육 기간에 공부했던 논문들을 리뷰했었는데, 이번 주부터 그동안 Compositional Generalization 서베이 논문들을 기반으로 작성해보려고 합니다. 금주 리뷰 논문은 Compositional Generalization…
[ECCV 2026] What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
최근 집중해서 보고있는 주제인 Composition의 원인을 VLM의 layer 별로 분석한 연구입니다. ECCV Oral 로 선정되었습니다 1. CLIP은 not을 이해하지 못한다? 다들 아시겠지만, CLIP과 같은 Vision-Language…
[RSS 2026] OpenFrontier: General Navigation with Visual-Language Grounded Frontiers
안녕하세요. 이번에 리뷰로 가져온 논문은 OpenFrontier: General Navigation with Visual-Language Grounded Frontiers라는 논문입니다. 일단 태스크 자체는 object goal navigation으로 텍스트로 object goal 을 넣어주면 주어진…
2026년 상반기 회고 – 이재윤
안녕하세요, 어느덧 입실 1년차(무려,,)를 향해가고 있는 이재윤입니다. 26년 새해가 되고 연초 아듀 세미나를 준비했던 것도 엊그제 같은데, 시간 참 빠른 것 같습니다. 이번 글에서는 연초…
2026년 상반기 회고 – 정의철
올해 상반기는 나에게 꽤 많은 변화가 있었던 시간이었다. 작년 IEEE Access 논문을 시작으로, 1저자로서 한 편의 논문을 처음부터 끝까지 작성하는 전체 사이클을 경험했다. 주제를 정하고…
[arXiv 2022] Video Diffusion Models
안녕하세요, 이번 리뷰는 video generation에 입문하고자 기초부터 다잡기 위해 읽게 된 논문입니다. GAN, VAE(Variational AutoEncoder) 등의 생성 모델에 기반하던 video generation에 diffusion을 처음으로(?) 적용시킨 연구입니다….
[CoRL 2025] Long Range Navigator (LRN): Extending robot planning horizons beyond metric maps
Introduction 로봇이 네비게이션을 할 때는 Global goal이 필요합니다. 그러나 저자는 prior(예를 들어, 위성지도)를 믿을 수 없을 때, 어떻게 해야할지에 대해 얘기를 시작합니다. 저자는 이러한 central…
[EMNLP 2025] ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
안녕하세요. 이번에는 ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration 논문을 읽어보았습니다. 요즘 MLLM 추론 연구가 죄다 “텍스트를 더 길게 생각하게…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…