Category: Paper
Paper Review
[ICLR 2025] MLLMS KNOW WHERE TO LOOK: TRAINING-FREE PERCEPTION OF SMALL VISUAL DETAILS WITH MULTIMODAL LLMS
안녕하세요 오늘은 MLLM이 작은 글자나 숫자 같은 세부 정보를 잘 읽지는 못하지만, 의외로 어디를 봐야 하는지는 알고 있을 수 있다! 라는 주장을 하는 논문을 가져왔습니다!논문의…
[RSS 2025] π0: A Vision-Language-Action Flow Model for General Robot Control
안녕하세요. 이번에 가져온 논문은 π 시리즈의 첫 논문인 π0를 가져왔습니다. 꾸준히 발전되어 π0.7까지 나온 것 같은데, 이런 최신 논문을 따라가기 위해 첫 논문을 자세히 읽어보자는…
[CVPR 2026] One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs
안녕하세요 이번에는 최근 token compression 논문들중 update 된 애들이 있나 살펴보고 찾은 논문입니다. 그럼 리뷰 시작하겠습니다. Abstract 우선 이 논문은 LVLM에서 visual token pruning을 layer별로…
[ICLR 2022] LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS
Abstract 안녕하세요, 강희승입니다. 오늘 리뷰해볼 논문은 LoRA입니다. LoRA는 해당 분야에서 획기적으로 학습할 파라미터의 수를 줄였고, 일부 파라미터만 fine-tuning함에도 불구하고, Full fine-tuning의 성능에 비해 drop이 크지…
[ICML 2026]EMBGUARD: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
안녕하세요. 이번에 리뷰로 가져온 논문은 ICML 2026에 게재된 EMBGUARD: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents라는 논문입니다. 해당 논문의 핵심만 먼저 간단하게 말씀드리면…
[ICML 2026] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
안녕하세요오늘은 ICML2026에 억셉된 논문이자 ICML참관했을때 주의깊게 봤던 포스터였던 논문인 Zooming without Zooming 논문을 리뷰해보겠습니다.들어가기에 앞서 간략하게 설명하자면 추론 과정에서 이미지의 작은 영역을 반복적으로 크롭하고 확대하는…
[ICLR 2021] AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE
안녕하세요. 강희승입니다. 지난주 Transformer에 이어, Computer Vision 연구에 Transformer를 적용한 ViT에 대해서 리뷰하려고 합니다. ViT는 현재 VLM에서도 많이 채택되어 활용되기 때문에, 다시 한번 복습하고자 해당…
[RSS 2024] Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
안녕하세요, 조성민입니다. 첫 글이다 보니 미숙한 점이 많을 것 같습니다. 내용 질문과 함께 글쓰기에 대한 피드백이 있다면 함께 댓글에 적어주시면 감사하겠습니다. 첫 리뷰를 어떤 논문으로…
[NIPS 2017] Attention Is All You Need
Context 안녕하세요, RCV 강희승 연구원입니다. ICML 이후 드디어 첫 X-review를 작성하게 되었습니다. RCV에 공식적으로 입실한 이후, 약 4개월이 지난 지금 기초교육 간 적지 않은 논문들을…
[ICML 2026] Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation
안녕하세요 이번에는 ICML 학회에 다녀오게 되면서 보게 된 포스터 논문 중 제가 연구하고 있는 분야와 동일 분야를 연구하고 있던 논문이 있어서 가져왔습니다. 기존에 VQA task…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…