Author: 정 의철

Posted in X-Diary

ICML 2026 참관기

안녕하세요. 이번에는 ICML 2026 학회에 참석하며 보고 들었던 연구들을 기준으로 전체적인 연구 흐름을 정리해보려 합니다. 학회장에 도착한 뒤 공개된 일정을 살펴보니 예상했던 것 이상으로 많은…

Continue Reading
Posted in X-Review

[2025 ACL] Shifting from Ranking to Set Selection for Retrieval Augmented Generation

이번 X-Review에서 소개할 논문은 Shifting from Ranking to Set Selection for Retrieval-Augmented Generation입니다. 이 논문은 RAG에서 retrieval을 단순히 관련 passage를 순위화하는 문제가 아니라, 질문에 필요한…

Continue Reading
Posted in X-Review

[NIPS 2025] Mitigating Semantic Collapse in Partially Relevant Video Retrieval

안녕하세요. 이번 X-Review에선 새롭게 Partially Relevant Video Retrieval(PRVR) 문제를 다룬 논문을 소개해드리고자 합니다. 이 논문은 PRVR에서 자주 발생하는 semantic collapse 문제를 text embedding과 video embedding…

Continue Reading
Posted in X-Review

[ICCV 2025] Principles of Visual Tokens for Efficient Video Understanding

안녕하세요. 이번에 소개할 논문은 Video Understanding에서의 token pruning을 다룬 논문입니다. 이 논문은 video token의 성질을 분석해, 모든 token이 같은 가치를 가지는 것이 아니라 소수의 핵심…

Continue Reading
Posted in X-Review

[2025 NIPS] HoliTom : Holistic Token Merging for Fast Video Large Language Models

안녕하세요. 이번에 소개할 논문은 video LLM의 추론 효율성을 개선하기 위한 token merging 방법을 제안한 논문입니다. 기존 연구들은 LLM에 입력되기 전에는 temporal merging과 spatial merging을 통해…

Continue Reading
Posted in X-Review

[arXiv 2026] VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

안녕하세요. 이번에 소개할 논문은 VLM의 fine-grained visual reasoning failure 분석에 관한 논문입니다. VLM이 광범위한 멀티모달 태스크에서는 좋은 성능을 보이고 있지만, 종종 fine-grained한 reasoning을 필요로하는 태스크에서는…

Continue Reading
Posted in X-Review

[CVPR 2024] MAFA: Managing False Negatives for Vision-Language Pre-training

1. Introduction Vision-Language Pre-training(VLP)은 대규모 웹 크롤링 이미지-텍스트 데이터셋을 바탕으로 학습되는 대표적인 멀티모달 사전학습 방식입니다. 보통은 self-supervised learning 형태로 학습되며, masked language modeling(MLM), image-text contrastive(ITC),…

Continue Reading
Posted in X-Review

[arXiv 2026] Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

안녕하세요. 최근 Multimodal LLM을 임베딩 모델로 활용하는 연구들에 관심을 가지면서 관련 논문들을 계속 살펴보고 있었는데, 이번에 소개할 논문은 reasoning 과정을 reinforcement learning으로 최적화해 멀티모달 임베딩…

Continue Reading
Posted in X-Review

[arXiv 2024] Pooling And Attention: What Are Effective Designs For LLM-Based Embedding Models?

안녕하세요. 이번에 소개할 논문은 LLM 기반 텍스트 임베딩 모델의 설계에 대해 분석한 연구입니다. 최근 LLM 기반 임베딩 모델로 실험을 진행하던 중, 어떤 구조적 설계가 성능에…

Continue Reading
Posted in X-Review

[AAAI 2026] UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

안녕하세요. 이번에 소개할 논문은 멀티모달 LLM을 범용 멀티모달 임베딩 모델로 확장하려는 연구입니다. 최근 MLLM을 단순 생성 모델이 아닌 임베딩 모델로도 활용하는 연구가 많이 늘고 있습니다….

Continue Reading