Category: X-Review

Paper, Conference, Seminar, API, Code, Dataset 등의 리뷰를 담을 예정입니다.

Posted in Paper X-Review

[RSS 2025] π0: A Vision-Language-Action Flow Model for General Robot Control

안녕하세요. 이번에 가져온 논문은 π 시리즈의 첫 논문인 π0를 가져왔습니다. 꾸준히 발전되어 π0.7까지 나온 것 같은데, 이런 최신 논문을 따라가기 위해 첫 논문을 자세히 읽어보자는…

Continue Reading
Posted in Paper X-Review

[CVPR 2026] One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

안녕하세요 이번에는 최근 token compression 논문들중 update 된 애들이 있나 살펴보고 찾은 논문입니다. 그럼 리뷰 시작하겠습니다. Abstract 우선 이 논문은 LVLM에서 visual token pruning을 layer별로…

Continue Reading
Posted in Paper X-Review

[ICLR 2022] LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS

Abstract 안녕하세요, 강희승입니다. 오늘 리뷰해볼 논문은 LoRA입니다. LoRA는 해당 분야에서 획기적으로 학습할 파라미터의 수를 줄였고, 일부 파라미터만 fine-tuning함에도 불구하고, Full fine-tuning의 성능에 비해 drop이 크지…

Continue Reading
Posted in X-Review

[ICML 2026] World-Model Inspired Emotion-aware Token Refinement for Training-Free Multimodal Emotion Recognition

안녕하세요. 이번에는 World-Model Inspired Emotion-aware Token Refinement for Training-Free Multimodal Emotion Recognition 논문을 읽어보았습니다. ICML 2026에 실린 논문인데요. 이 논문은 감정 인식 모델을 다시 학습시키지…

Continue Reading
Posted in X-Diary X-Review

ICML 참관기

안녕하세요, 손우진입니다. 조금 시간은 지났지만 코엑스에서 열린 ICML 2026에 다녀와 참관기를 남깁니다. 저번주 세미나를 준비하면서 다시금 상기시켰던 ICML의 기억을담아 작성해보도록 하겠습니다 다들 아시겠지만 학회 첫날…

Continue Reading
Posted in Paper X-Review

[ICML 2026]EMBGUARD: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

안녕하세요. 이번에 리뷰로 가져온 논문은 ICML 2026에 게재된 EMBGUARD: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents라는 논문입니다. 해당 논문의 핵심만 먼저 간단하게 말씀드리면…

Continue Reading
Posted in X-Review

[NeurIPS 2025]VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning

Abstract few-shot learning은 Few-shot의 labeled support 데이터를 통해 새로운 개념을 인식하는 것을 목표로 하며, 최근 연구들은 클래스에 대한 description과 같은 추가적인 정보를 통합하는 방식으로 연구가…

Continue Reading
Posted in X-Review

[NeurIPS 2024] SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations

저는 최근 VLM의 일반화 능력에 관한 논문을 보면서, 막연하게 “VLM은 유의어나 서로 다른 표현을 같은 의미로 이해할 수 있을까?”라는 의문을 가지고 있었습니다. 이러한 의문이 들었던…

Continue Reading
Posted in X-Review

[ICML 2026] Causal-JEPA: Learning World Models through Object-Level Latent Masking

안녕하세요. 오늘은 ICML 2026에서 소개된 Causal-JEPA(C-JEPA)를 리뷰해보도록 하겠습니다. 제목을 직역하면 객체 단위의 latent masking을 통한 world model 학습인데요, 핵심 컨셉은 object-level masking을 통해 객체 간…

Continue Reading
Posted in Paper X-Review

[ICML 2026] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

안녕하세요오늘은 ICML2026에 억셉된 논문이자 ICML참관했을때 주의깊게 봤던 포스터였던 논문인 Zooming without Zooming 논문을 리뷰해보겠습니다.들어가기에 앞서 간략하게 설명하자면 추론 과정에서 이미지의 작은 영역을 반복적으로 크롭하고 확대하는…

Continue Reading