[CVPR 2026(Highlight)]CLIP Is Shortsighted: Paying Attention Beyond the First Sentence
Abstract CLIP은 두드러지는 객체에 대한 단순한 설명을 인코딩하도록 학습되었으며, 이로 인해 복잡한 장면이나 밀도 높은 description에 대해서는 이미지와 텍스트 사이의 정력이 잘 맞지 않는 문제가…
[CVPR 2024] BoQ: A Place is Worth a Bag of Learnable Queries
안녕하세요 다시 Visual Place Recognition 논문으로 돌아왔습니다. 오늘 소개할 논문은 Learnable Query를 이용하여 VPR을 진행하는 논문입니다. 정말 간단한 구조로 이루어져 있지만 높은 성능을 달성하였습니다. 시작해보겠습니다….
[ICLR 2026] UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
안녕하세요. 이번에 리뷰로 가져온 논문은 ICLR 2026에 게재된 UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos라는 논문입니다. 이 논문은 제목 그대로 city-tour video 도시 투어…
[2025 NIPS] HoliTom : Holistic Token Merging for Fast Video Large Language Models
안녕하세요. 이번에 소개할 논문은 video LLM의 추론 효율성을 개선하기 위한 token merging 방법을 제안한 논문입니다. 기존 연구들은 LLM에 입력되기 전에는 temporal merging과 spatial merging을 통해…
[arxiv 2025] Is Diversity All You Need for Scalable Robotic Manipulation?
안녕하세요, 이번에는 로봇 조작 학습에서 데이터 다양성이 정말 항상 좋은 것인지에 대해 다룬 연구를 리뷰해보려고 합니다. Agibot에서 진행한 연구이고, 저자들은 task diversity, multi-embodiment pre-training, expert…
[ICLR 2026] CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally
이번 논문은 “CLIP은 정말 Bag-of-Words처럼밖에 이해하지 못하는가?”라는 질문에서 시작하는데요, CLIP의 compositionality failure 원인을 encoder 내부 정보 부족과 cross-modal alignment 문제로 분리해 분석한 연구입니다. Venue: ICLR 2026…
[CVPR2025] Video Depth Anything
Intro 최근 단안 깊이 추정(Monocular Depth Estimation, MDE)은 깊이 파운데이션 모델(depth foundation model)의 발전에 힘입어 좋은 모습을 보여주고 있습니다. 그러나 이러한 모델들은 여전히 한계가 있는데…
[NeurIPS 2025] FastVID: Dynamic Density Pruning for Fast Video Large Language Models
안녕하세요 오늘은 multimodal token compression관련 논문을 읽어보겠습니다. Intro 최근의 Video-LLM은 video understanding에서 좋은 성능을 보여주고 있습니다. 하지만 비디오는 여러 프레임으로 구성되어 있고 또 각 프레임마다…
[HRI 2026] Learning Human Preferences over a Human-Robot Collaboration Based on Explicit and Implicit Human Feedback
안녕하세요. 이번 논문은 preference-aware 논문이지만 특이하게 implicit human feedback까지 고려하는 논문을 가져와봤습니다. 그럼 시작해보겠습니다. 1. Introduction 로봇 하드웨어와 physical manipulation 능력이 발전하면서, 로봇이 사람 사용자에…
[CoRL 2024] APRICOT : Active Preference Learning and Constraint-Aware Task Planning with LLMs
오늘은 preference-aware 논문을 가져와봤습니다. preference-aware는 로봇이 사람의 선호하는 바를 인지하고 이를 action에 반영하는 논문이라고 보시면 되겠습니다. 사람과 로봇의 introduction이 흥미가 있어 읽어봤습니다. 그럼 리뷰 시작하겠습니다….
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…