Author: 정 의철
[CVPR 2025]ShowUI: One Vision-Language-Action Model for GUI Visual Agent
안녕하세요. 오늘의 X-Review는 GUI Agent 방법론인 ShowUI를 소개해드리고자 합니다. 최근 GUI Agent 분야에 관심이 생겨 관련 논문들을 찾아보던 중 읽게 되었으며, 25년도 CVPR에 게재된 논문입니다….
2026년 상반기 회고 – 정의철
올해 상반기는 나에게 꽤 많은 변화가 있었던 시간이었다. 작년 IEEE Access 논문을 시작으로, 1저자로서 한 편의 논문을 처음부터 끝까지 작성하는 전체 사이클을 경험했다. 주제를 정하고…
[CVPR 2026] An Empirical Study on How Video-LLMs Answer Video Questions
1. Introduction 최근 Video-LLM은 단순히 이미지 한 장을 이해하는 것을 넘어, 여러 프레임으로 구성된 비디오의 내용을 이해하고 다양한 형태의 질문에 답할 수 있을 정도로 빠르게…
[CVPR 2026] Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
1. Introduction Qwen-VL이나 LLaVA와 같은 Vision-Language Model(VLM)은 이미지를 이해하고, 이미지에 대한 질문에 답하거나 복잡한 시각적 추론을 수행하는 등 다양한 vision-language task에서 좋은 성능을 보여주고 있습니다….
ICML 2026 참관기
안녕하세요. 이번에는 ICML 2026 학회에 참석하며 보고 들었던 연구들을 기준으로 전체적인 연구 흐름을 정리해보려 합니다. 학회장에 도착한 뒤 공개된 일정을 살펴보니 예상했던 것 이상으로 많은…
[2025 ACL] Shifting from Ranking to Set Selection for Retrieval Augmented Generation
이번 X-Review에서 소개할 논문은 Shifting from Ranking to Set Selection for Retrieval-Augmented Generation입니다. 이 논문은 RAG에서 retrieval을 단순히 관련 passage를 순위화하는 문제가 아니라, 질문에 필요한…
[NIPS 2025] Mitigating Semantic Collapse in Partially Relevant Video Retrieval
안녕하세요. 이번 X-Review에선 새롭게 Partially Relevant Video Retrieval(PRVR) 문제를 다룬 논문을 소개해드리고자 합니다. 이 논문은 PRVR에서 자주 발생하는 semantic collapse 문제를 text embedding과 video embedding…
[ICCV 2025] Principles of Visual Tokens for Efficient Video Understanding
안녕하세요. 이번에 소개할 논문은 Video Understanding에서의 token pruning을 다룬 논문입니다. 이 논문은 video token의 성질을 분석해, 모든 token이 같은 가치를 가지는 것이 아니라 소수의 핵심…
[2025 NIPS] HoliTom : Holistic Token Merging for Fast Video Large Language Models
안녕하세요. 이번에 소개할 논문은 video LLM의 추론 효율성을 개선하기 위한 token merging 방법을 제안한 논문입니다. 기존 연구들은 LLM에 입력되기 전에는 temporal merging과 spatial merging을 통해…
[arXiv 2026] VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
안녕하세요. 이번에 소개할 논문은 VLM의 fine-grained visual reasoning failure 분석에 관한 논문입니다. VLM이 광범위한 멀티모달 태스크에서는 좋은 성능을 보이고 있지만, 종종 fine-grained한 reasoning을 필요로하는 태스크에서는…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…