Category: X-Review

Paper, Conference, Seminar, API, Code, Dataset 등의 리뷰를 담을 예정입니다.

Posted in Paper X-Review

[ICLR 2021] AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE

안녕하세요. 강희승입니다. 지난주 Transformer에 이어, Computer Vision 연구에 Transformer를 적용한 ViT에 대해서 리뷰하려고 합니다. ViT는 현재 VLM에서도 많이 채택되어 활용되기 때문에, 다시 한번 복습하고자 해당…

Continue Reading
Posted in X-Review

[ICRA 2025] Dual-BEV Nav: Dual-layer BEV-based Heuristic Path Planning for Robotic Navigation in Unstructured Outdoor Environments

Introduction 여전히 저자들은 로봇이 path planning을 잘못하고 있다고 시작합니다. 먼저 local한 path planning 관점에서는 outdoor의 변화무쌍한 환경으로 인해 traversability map을 제대로 감지 못한다고 합니다. 이를…

Continue Reading
Posted in X-Review

[CVPR2025] ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

Abstrcat 대규모 이미지-텍스트 데이터로 학습된 VLM은 classification에서 상당한 개선을 이루었으나, 모델의 성능이 프롬프트 품질에 의존하게 됩니다. 최근 연구들은 LLM이 생성한 시각적 설명이 VLM의 일반화 능력을…

Continue Reading
Posted in X-Review

[ICML 2026] Adaptive Token Refinement in Long-Tailed Large Vision-Language Models Fine-Tuning

대부분의 모델이 가지는 long-tailed 문제를 해결하려고 한 ICML 논문에 대해 리뷰해보겠습니다. Venue: ICML 2026Authors: Wenjun Miao, Mingda Li, Yanchao Hao, Zheng WeiAffiliation: Beihang University (Beijing), Tencent…

Continue Reading
Posted in X-Review

[arXiv 2026] XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

안녕하세요. 이번에는 XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning 논문을 읽어봤습니다. 해당 논문은 감정 인식 AI가 “이 사람은 슬퍼 보인다”에서…

Continue Reading
Posted in X-Review

[arXiv 2025] UniFGVC: Universal Training-Free Few-Shot Fine-Grained Visual Classification via Attribute-Aware Multimodal Retrieval

안녕하세요. 이번주에는 retrieval로 few-shot fine-grained visual classification(FGVC)를 수행하는 UniFGVC라는 논문을 소개하고자 합니다. 1. Introduction Fine-grained visual classification(FGVC)은 조류 종이나 자동차 모델처럼 더 넓은 상위 범주(superordinate…

Continue Reading
Posted in Paper X-Review

[RSS 2024] Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots

안녕하세요, 조성민입니다. 첫 글이다 보니 미숙한 점이 많을 것 같습니다. 내용 질문과 함께 글쓰기에 대한 피드백이 있다면 함께 댓글에 적어주시면 감사하겠습니다. 첫 리뷰를 어떤 논문으로…

Continue Reading
Posted in Paper X-Review

[NIPS 2017] Attention Is All You Need

Context 안녕하세요, RCV 강희승 연구원입니다. ICML 이후 드디어 첫 X-review를 작성하게 되었습니다. RCV에 공식적으로 입실한 이후, 약 4개월이 지난 지금 기초교육 간 적지 않은 논문들을…

Continue Reading
Posted in X-Review

[CVPR 2026]SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names

Abstract OVD는 임의의 텍스트로 설명되는 객체 탐지를 목표로 하지만, 대부분 coarse한 수준에서 동작하며, 세밀한 속성에는 동작하는 데 어려움을 겪습니다. 해당 논문은 모델과 데이터 두 관점에서…

Continue Reading
Posted in X-Review

[ICCV2023] Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture

안녕하세요 손우진입니다. 이번에 리뷰할 논문은 self-supervised learning 방법론인 I-JEPA입니다. 사실 JEPA는 얀 르쿤이 주도한 방법론이라 발표 당시부터 많은 주목을 받았고, 최근 ICML 2026에 참관을 다녀오면서도…

Continue Reading