Category: X-Review
Paper, Conference, Seminar, API, Code, Dataset 등의 리뷰를 담을 예정입니다.
[CVPR 2026] FINER: MLLMs Hallucinate under Fine-grained Negative Queries
안녕하세요 오늘은 MLLM의 fine grained hallucination과 관련된 FINER논문을 읽어봤습니다CVPR 2026 oral논문이고 MLLM 모델이 이미지 속의 시각적인 정보와 텍스트를 real로 세밀하게 맞춰 보고 있는지! 라는 문제의식이…
[ArXiv 2026]From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation 라는 논문 입니다. 간단하게 컨셉만 설명을 드리면 논문 제목처럼…
[CVPR 2026] POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval
Abstract retrieval에서 embedding 생성에 사용되는 대부분의 모델은 다른 목적으로 학습이 되다 보니 물체의 세부 속성보다 coarse한 물체에 집중하는 경향이 있습니다. 또한, 서로 다른 description을 구분하는…
[ICRA 2026] VITRA : Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
안녕하세요, 이번주 X-review는 unscripted real-life human video를 VLA pretraining 데이터로 바꾸는 연구를 리뷰해보려고 합니다. 지난 ActiveMimic 리뷰에 이어 egocentric human video를 로봇 학습으로 끌어오는 결의…
[NIPS 2025] Mitigating Semantic Collapse in Partially Relevant Video Retrieval
안녕하세요. 이번 X-Review에선 새롭게 Partially Relevant Video Retrieval(PRVR) 문제를 다룬 논문을 소개해드리고자 합니다. 이 논문은 PRVR에서 자주 발생하는 semantic collapse 문제를 text embedding과 video embedding…
[ICML 2026 Oral] Necessary Conditions for Compositional Generalization of Embedding Models
오늘 리뷰는 생각보다 기네요.. compositional generalization을 위한 임베딩 구조는 무엇인가? 에 대한 답변을 찾기위해 고민한 페이퍼입니다. Venue: ICML 2026 OralAuthors: Arnas Uselis, Andrea Dittadi, Seong Joon…
[arXiv2026] What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems
Intro LLM의 활용 형태중 하나로 MAS(multi agent system)이 활발하게 연구되고 있습니다. 최근 연구는 특히 roles 제안이나 tool 구성 제안과 같은 방식으로 이루어지고 있는데, 에이전트간 소통의…
[Arxiv 2022] Exploring Visual Explanations for Contrastive Language-Image Pre-training
안녕하세요 이번에 들고온 논문은 CLIP 의 Vision 과 Text embedding의 similarity map 이 기대하는 경향성과는 반대라는점을 밝히고 개선한 논문입니다. Abstract 우선 저자는 Contrastive Language-Image Pre-training,…
[CVPR 2026] WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
안녕하세요. 오늘 소개할 논문은 중국의 대표 메신저 기업 WeChat에서 CVPR 2026에 개제한 논문으로, OVOD를 vision-language의 fusion 없이 단순한 retrieval 문제로 재정의한 논문입니다. 1. Introduction 컴퓨터…
[CVPR 2026] Back to Basics: Let Denoising Generative Models Denoise
안녕하세요. 이번 x-review는 최근 이미지 생성 분야에서 큰 주목을 받고 있는 논문인 “Back to Basics: Let Denoising Generative Models Denoise”입니다. MIT의 Tianhong Li와 Kaiming He가…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…