Author: 정 의철

Posted in X-Review

[CVPR 2025]ShowUI: One Vision-Language-Action Model for GUI Visual Agent

안녕하세요. 오늘의 X-Review는 GUI Agent 방법론인 ShowUI를 소개해드리고자 합니다. 최근 GUI Agent 분야에 관심이 생겨 관련 논문들을 찾아보던 중 읽게 되었으며, 25년도 CVPR에 게재된 논문입니다….

Continue Reading
Posted in X-Review

2026년 상반기 회고 – 정의철

올해 상반기는 나에게 꽤 많은 변화가 있었던 시간이었다. 작년 IEEE Access 논문을 시작으로, 1저자로서 한 편의 논문을 처음부터 끝까지 작성하는 전체 사이클을 경험했다. 주제를 정하고…

Continue Reading
Posted in X-Review

[CVPR 2026] An Empirical Study on How Video-LLMs Answer Video Questions

1. Introduction 최근 Video-LLM은 단순히 이미지 한 장을 이해하는 것을 넘어, 여러 프레임으로 구성된 비디오의 내용을 이해하고 다양한 형태의 질문에 답할 수 있을 정도로 빠르게…

Continue Reading
Posted in X-Review

[CVPR 2026] Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

1. Introduction Qwen-VL이나 LLaVA와 같은 Vision-Language Model(VLM)은 이미지를 이해하고, 이미지에 대한 질문에 답하거나 복잡한 시각적 추론을 수행하는 등 다양한 vision-language task에서 좋은 성능을 보여주고 있습니다….

Continue Reading
Posted in X-Diary

ICML 2026 참관기

안녕하세요. 이번에는 ICML 2026 학회에 참석하며 보고 들었던 연구들을 기준으로 전체적인 연구 흐름을 정리해보려 합니다. 학회장에 도착한 뒤 공개된 일정을 살펴보니 예상했던 것 이상으로 많은…

Continue Reading
Posted in X-Review

[2025 ACL] Shifting from Ranking to Set Selection for Retrieval Augmented Generation

이번 X-Review에서 소개할 논문은 Shifting from Ranking to Set Selection for Retrieval-Augmented Generation입니다. 이 논문은 RAG에서 retrieval을 단순히 관련 passage를 순위화하는 문제가 아니라, 질문에 필요한…

Continue Reading
Posted in X-Review

[NIPS 2025] Mitigating Semantic Collapse in Partially Relevant Video Retrieval

안녕하세요. 이번 X-Review에선 새롭게 Partially Relevant Video Retrieval(PRVR) 문제를 다룬 논문을 소개해드리고자 합니다. 이 논문은 PRVR에서 자주 발생하는 semantic collapse 문제를 text embedding과 video embedding…

Continue Reading
Posted in X-Review

[ICCV 2025] Principles of Visual Tokens for Efficient Video Understanding

안녕하세요. 이번에 소개할 논문은 Video Understanding에서의 token pruning을 다룬 논문입니다. 이 논문은 video token의 성질을 분석해, 모든 token이 같은 가치를 가지는 것이 아니라 소수의 핵심…

Continue Reading
Posted in X-Review

[2025 NIPS] HoliTom : Holistic Token Merging for Fast Video Large Language Models

안녕하세요. 이번에 소개할 논문은 video LLM의 추론 효율성을 개선하기 위한 token merging 방법을 제안한 논문입니다. 기존 연구들은 LLM에 입력되기 전에는 temporal merging과 spatial merging을 통해…

Continue Reading
Posted in X-Review

[arXiv 2026] VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

안녕하세요. 이번에 소개할 논문은 VLM의 fine-grained visual reasoning failure 분석에 관한 논문입니다. VLM이 광범위한 멀티모달 태스크에서는 좋은 성능을 보이고 있지만, 종종 fine-grained한 reasoning을 필요로하는 태스크에서는…

Continue Reading