Author: 홍 주영
[ICML 2026] Adaptive Token Refinement in Long-Tailed Large Vision-Language Models Fine-Tuning
대부분의 모델이 가지는 long-tailed 문제를 해결하려고 한 ICML 논문에 대해 리뷰해보겠습니다. Venue: ICML 2026Authors: Wenjun Miao, Mingda Li, Yanchao Hao, Zheng WeiAffiliation: Beihang University (Beijing), Tencent…
ICML 2026 참관기
코엑스에서 열린 ICML 2026에 참석한 후기를 작성해보겠습니다. https://youtu.be/RUvbfNvj3Lk인상깊게 봤던 페이퍼에 대한 세미나는 위에 링크에 걸어두었습니다. 그리고 살펴봤던 페이퍼는 제가 개인적으로 정리해두기도 했고, 발표로도 다뤄봤으니…다이어리에는 학회에…
[ICML 2026] Are Object-Centric Representations Better At Compositional Generalization?
오늘은 object-centric representation이 정말로 composition 능력에 강인한가? 에 대해 분석한 논문을 리뷰해보겠습니다. Venue: ICML 2026 Authors: Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik…
Protected: [Peer Review] Text-Conditioned Static-Dynamic Composition for Composed Video Retrieval
There is no excerpt because this is a protected post.
[ICML 2026 Oral] Necessary Conditions for Compositional Generalization of Embedding Models
오늘 리뷰는 생각보다 기네요.. compositional generalization을 위한 임베딩 구조는 무엇인가? 에 대한 답변을 찾기위해 고민한 페이퍼입니다. Venue: ICML 2026 OralAuthors: Arnas Uselis, Andrea Dittadi, Seong Joon…
[Arxiv 2026] Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference
지난주에 리뷰한 [ICLR 2026] CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally 와 비슷한 계열의 의문을 제기한 페이퍼를 한번 리뷰해보겠습니다 Venue: Arxiv 2026 Authors:…
[ICLR 2026] CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally
이번 논문은 “CLIP은 정말 Bag-of-Words처럼밖에 이해하지 못하는가?”라는 질문에서 시작하는데요, CLIP의 compositionality failure 원인을 encoder 내부 정보 부족과 cross-modal alignment 문제로 분리해 분석한 연구입니다. Venue: ICLR 2026…
[Arxiv 2024] Pooling And Attention: What Are Effective Designs For LLM-Based Embedding Models?
오늘은 생성형 모델인 LLM을 임베딩 모델로 변환하는 것과 관련된 페이퍼를 리뷰해보겠습니다. Venue: Arxiv 2024Authors: Yixuan Tang, Yi YangAffiliation: The Hong Kong University of Science and TechnologyTitle: Pooling…
[CVPR 2025] Bridging Modalities: Improving Universal Multimodal Retrieval by Multimodal Large Language Models
이번에 읽은 논문은 universal multimodal retrieval, 줄여서 UMR 이라는 태스크를 다루는 논문입니다. 지금까지도 UMR 에 대한 페이퍼가 계속 나오고 있는데요. 이 논문의 핵심은, 좋은 universal…
[CVPR 2025] VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
오늘은 비디오에서의 compositionality 를 분석한 논문을 리뷰해보겠습니다. 리뷰하고보니, 2022년에 저희 연구실에서 세미나를 진행해주신 구글 딥마인드의 김다훈 박사님의 논문이네요 리뷰 시작해보겠습니다. Venue: CVPR 2025 Authors: Dahun Kim,…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…