Recent Posts
[ECCV 2026] Open-Vocabulary Long-term Action Anticipation
안녕하세요. 이번 리뷰에서는 ECCV 2026에서 접한 Long-term Action Anticipation 논문을 가져왔습니다. Long-term Action Anticipation(LTA)은 관찰된 비디오를 바탕으로, 이후에 이어질 Z개의 행동으로 이루어진 시퀀스를 예측하는 task입니다….
[CVPR 2026] Latent Implicit Visual Reasoning
안녕하세요. 이번에는 Latent Implicit Visual Reasoning (LIVR) 논문을 읽어보았습니다. 지난번에 리뷰한 Coconut이 LLM의 reasoning을 language space에서 continuous latent space로 옮겼다면, 이번 논문은 비슷한 문제의식을 Large…
[CVPR 2025] Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
안녕하세요. 이번 주는 Image representation의 구조도 text representation과 같이 attribute, object, relation 과 같은 concept들을 분리하고 재조합할 수 있는 구조를 가지고 있는 지에 대해 연구한…
[AAAI 2024] GMMFormer: Gaussian-Mixture-Model Based Transformer for EfficientPartially Relevant Video Retrieval
안녕하세요. 오늘의 리뷰도 PRVR 관련 논문을 리뷰하고자 합니다. 이번 논문은 최근 PRVR 연구들에서 베이스라인으로 많이 사용되는 방법론입니다. 그럼 바로 리뷰 시작하겠습니다. 1. Introduction 최근 비디오가…
[RA-L 2021] M2DGR: A Multi-sensor and Multi-scenario SLAM Dataset for Ground Robots
안녕하세요. 이번에 리뷰로 가져온 논문은 M2DGR: A Multi-sensor and Multi-scenario SLAM Dataset for Ground Robots라는 논문입니다. 일단 해당 논문은 새로운 SLAM 알고리즘이나 학습 모델을 제안하는…
ECCV 2026 참관기
안녕하세요, 오늘은 9.8~9.12 동안 개최되었던 ECCV 2026 참관기를 작성해보려고 합니다. 저는 저번 겨울 근택님, 성준님과 작업했던 Video-Oasis : Rethinking Evaluation of Video Understanding 이 ECCV…
[COLM 2026] The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
1. MLLM은 이미지를 얼마나 보고 있을까? 다들 아시겠지만, MLLM은 이미지와 텍스트를 함께 입력받아 질문에 답합니다. 그런데 이미지를 입력받는다는 것이, 시각 정보를 충분히 활용한다는 뜻일까요? 기존…
[arXiv 2026] Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation
Introduction 로봇이 이미지를 받아서 주행하는 측면에서 현재 학습 기반 방법론(NoMAD, ViNT)가 충돌없이 잘 주행하는 편입니다. 하지만 진짜 어려운 부분들은 모델이 전부 갈수 있을거 같은 후보를…
[CVPR 2026] Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
안녕하세요. 오늘의 X-Review는 DreamPRVR이라는 PRVR 논문입니다. 최근 저도 PRVR을 연구하면서 frame과 clip 수준의 local matching을 어떻게 개선할지 여러 실험을 진행하고 있는데, DreamPRVR에서 문제를 바라보는 관점이…
[Arxiv 2026] Support×Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions
1. Vision Encoder는 정말 Compositional할까? 최근 DINOv3나 SigLIP2와 같은 Vision Encoder들은 이미지의 객체, 위치, 속성 등 다양한 정보를 상당히 잘 표현한다고 알려져 있습니다. 그렇다면 여기서…
안녕하세요 우진님 좋은 리뷰 감사합니다. 객체 포인트 클라우드를 이전 프레임의 pose로 배치해서 사용한다고 했는데 이전 추정이 크게 틀리면 다음 추정도…