Author: 이 예은
[ICML 2026] Causal-JEPA: Learning World Models through Object-Level Latent Masking
안녕하세요. 오늘은 ICML 2026에서 소개된 Causal-JEPA(C-JEPA)를 리뷰해보도록 하겠습니다. 제목을 직역하면 객체 단위의 latent masking을 통한 world model 학습인데요, 핵심 컨셉은 object-level masking을 통해 객체 간…
[arXiv 2025] UniFGVC: Universal Training-Free Few-Shot Fine-Grained Visual Classification via Attribute-Aware Multimodal Retrieval
안녕하세요. 이번주에는 retrieval로 few-shot fine-grained visual classification(FGVC)를 수행하는 UniFGVC라는 논문을 소개하고자 합니다. 1. Introduction Fine-grained visual classification(FGVC)은 조류 종이나 자동차 모델처럼 더 넓은 상위 범주(superordinate…
ICML 2026 참관기
이번주는 ICML 2026 참관기를 작성해보려고 합니다. 이번 ICML은 서울 코엑스에서 열렸고, 저는 본 학회가 진행된 7월 7일부터 9일까지 3일 동안 참석하였습니다. 제출 논문이 23,918편으로 작년의…
[CVPR 2026] WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
안녕하세요. 오늘 소개할 논문은 중국의 대표 메신저 기업 WeChat에서 CVPR 2026에 개제한 논문으로, OVOD를 vision-language의 fusion 없이 단순한 retrieval 문제로 재정의한 논문입니다. 1. Introduction 컴퓨터…
[AAAI 2025] Does VLM Classification Benefit from LLM Description Semantics?
1. Introduction CLIP을 비롯한 이후의 다양한 VLM 모델들은 이미지와 텍스트를 공유된 임베딩 공간에 정렬하여 시각 정보와 언어 정보 간의 상관관계를 향상시켜 오고 있습니다. VLM은 이미지를…
[CVPR 2026 Highlight] Batch Loss Score for Dynamic Data Pruning
안녕하세요, 이번주도 data pruning 논문을 가져왔습니다. 저번에 리뷰했던 SeTa의 저자가 RePB(ICLR 2026), 그리고 오늘 리뷰할 BLS까지 dynamic data pruning의 연구를 활발하게 이끌고 있는 것 같습니다….
[NeurIPS 2025] RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
안녕하세요. 오늘 소개드릴 논문은 3D-aware VLM인 RoboRefer입니다. 1. Introduction 로봇이 복잡한 환경과 잘 상호작용하기 위해서는 3D 공간을 이해하는 것이 중요합니다. 따라서 embodied AI에서는 open-world spatial…
[CVPR 2025] Scale Efficient Training for Large Datasets
안녕하세요. 오늘은 data pruning 관련 논문을 리뷰해보도록 하겠습니다. 3월부터 상인님의 논문 작업을 도우며 초기 실험과 공부를 진행하고 있는데요, 저희가 진행 중인 task가 바로 data pruning입니다….
[ECCV 2024] ArtVLM: Attribute Recognition Through Vision-Based Prefix Language Modeling
안녕하세요. 이번에 리뷰할 논문은 Google Research에서 ECCV 2024에 발표한 논문으로, VLM의 문장 생성 능력을 활용해 attribute recognition을 해결하고자 한 논문입니다. 속성과 같이 객체의 fine-grained한 특성을…
[ICRA 2025] Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs
안녕하세요. 이번 X-Review에서는 로봇 관점에서 attribute를 알아내고자 하는 논문에 대해 다루어보려고 합니다. CaP나 VoxPoser와 마찬가지로 LLM이 직접 코드를 생성해 계층적으로 API를 호출하는 방식을 활용하며, 이를…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…