Author: 강 희승
[2025 CVPR] CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
안녕하세요 강희승입니다. 오늘 소개드릴 논문은 CLIP의 text/visual encoder가 각각 first mentioned object, larger object에 대해 bias를 가지고 있고, 해당 bias가 어디서 기원한 것인지 연구한 논문입니다….
[ICML 2026] Global Geometry Is Not Enough for Vision Representations
안녕하세요, 강희승입니다. 지난 방학 동안 기초교육 기간에 공부했던 논문들을 리뷰했었는데, 이번 주부터 그동안 Compositional Generalization 서베이 논문들을 기반으로 작성해보려고 합니다. 금주 리뷰 논문은 Compositional Generalization…
2026년 상반기 회고 – 강희승
Intro 안녕하세요, 강희승입니다.제가 RCV lab에 입실하게 된지 어느덧 6개월이 지났습니다. 순탄할 줄만 알았던 첫 상반기, 겪었던 문제들과 생각들을 이번 회고를 통해 공유해보려고 합니다. 신입의 마음가짐…
[arXiv 2025] SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
Abstract 안녕하세요, 강희승입니다. 오늘은 지난주에 리뷰한 SigLIP의 후속 연구로, Google DeepMind에서 발표한 SigLIP2를 리뷰해보려고 합니다. SigLIP의 경우, Memory efficiency, 모델의 확장성, 학습 과정에서 효율성 등의…
[ICCV 2023] Sigmoid Loss for Language Image Pre-Training
Prologue 안녕하세요. 강희승입니다. 이번에는 SigLIP입니다. 기초교육 간 읽은 논문 중 최대한 X-review에 작성되지 않은 논문들을 리뷰해보려고 합니다. SigLIP도 최근 자주 쓰이는 Visual Backbone으로 알고 있는데,…
[ICLR 2022] LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS
Abstract 안녕하세요, 강희승입니다. 오늘 리뷰해볼 논문은 LoRA입니다. LoRA는 해당 분야에서 획기적으로 학습할 파라미터의 수를 줄였고, 일부 파라미터만 fine-tuning함에도 불구하고, Full fine-tuning의 성능에 비해 drop이 크지…
[ICLR 2021] AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE
안녕하세요. 강희승입니다. 지난주 Transformer에 이어, Computer Vision 연구에 Transformer를 적용한 ViT에 대해서 리뷰하려고 합니다. ViT는 현재 VLM에서도 많이 채택되어 활용되기 때문에, 다시 한번 복습하고자 해당…
[NIPS 2017] Attention Is All You Need
Context 안녕하세요, RCV 강희승 연구원입니다. ICML 이후 드디어 첫 X-review를 작성하게 되었습니다. RCV에 공식적으로 입실한 이후, 약 4개월이 지난 지금 기초교육 간 적지 않은 논문들을…
ICML 2026 참관기
안녕하세요, RCV 신입 연구원 강희승입니다. 2026년 7월에 ICML이라는 인공지능 최고 학회가 한국에서 열렸고, 좋은 기회로 다녀오게 되어, 참관기를 작성해보려고 합니다. 첫 학회이다 보니, 설레기도 했지만,…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…