Posted in Paper X-Review

[ICML 2026]EMBGUARD: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

안녕하세요. 이번에 리뷰로 가져온 논문은 ICML 2026에 게재된 EMBGUARD: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents라는 논문입니다. 해당 논문의 핵심만 먼저 간단하게 말씀드리면…

Continue Reading
Posted in X-Review

[NeurIPS 2025]VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning

Abstract few-shot learning은 Few-shot의 labeled support 데이터를 통해 새로운 개념을 인식하는 것을 목표로 하며, 최근 연구들은 클래스에 대한 description과 같은 추가적인 정보를 통합하는 방식으로 연구가…

Continue Reading
Posted in X-Review

[NeurIPS 2024] SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations

저는 최근 VLM의 일반화 능력에 관한 논문을 보면서, 막연하게 “VLM은 유의어나 서로 다른 표현을 같은 의미로 이해할 수 있을까?”라는 의문을 가지고 있었습니다. 이러한 의문이 들었던…

Continue Reading
Posted in X-Review

[ICML 2026] Causal-JEPA: Learning World Models through Object-Level Latent Masking

안녕하세요. 오늘은 ICML 2026에서 소개된 Causal-JEPA(C-JEPA)를 리뷰해보도록 하겠습니다. 제목을 직역하면 객체 단위의 latent masking을 통한 world model 학습인데요, 핵심 컨셉은 object-level masking을 통해 객체 간…

Continue Reading
Posted in Paper X-Review

[ICML 2026] Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

안녕하세요오늘은 ICML2026에 억셉된 논문이자 ICML참관했을때 주의깊게 봤던 포스터였던 논문인 Zooming without Zooming 논문을 리뷰해보겠습니다.들어가기에 앞서 간략하게 설명하자면 추론 과정에서 이미지의 작은 영역을 반복적으로 크롭하고 확대하는…

Continue Reading
Posted in Paper X-Review

[ICLR 2021] AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE

안녕하세요. 강희승입니다. 지난주 Transformer에 이어, Computer Vision 연구에 Transformer를 적용한 ViT에 대해서 리뷰하려고 합니다. ViT는 현재 VLM에서도 많이 채택되어 활용되기 때문에, 다시 한번 복습하고자 해당…

Continue Reading
Posted in X-Review

[ICRA 2025] Dual-BEV Nav: Dual-layer BEV-based Heuristic Path Planning for Robotic Navigation in Unstructured Outdoor Environments

Introduction 여전히 저자들은 로봇이 path planning을 잘못하고 있다고 시작합니다. 먼저 local한 path planning 관점에서는 outdoor의 변화무쌍한 환경으로 인해 traversability map을 제대로 감지 못한다고 합니다. 이를…

Continue Reading
Posted in X-Review

[CVPR2025] ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

Abstrcat 대규모 이미지-텍스트 데이터로 학습된 VLM은 classification에서 상당한 개선을 이루었으나, 모델의 성능이 프롬프트 품질에 의존하게 됩니다. 최근 연구들은 LLM이 생성한 시각적 설명이 VLM의 일반화 능력을…

Continue Reading
Posted in X-Diary

ICML 2026 참관기

안녕하세요. 서울 코엑스에서 열린 ICML을 다녀오며 느낀점을 참관기로 남겨보려합니다. ICML은 ML 분야 최상위 학회이고 서울 코엑스에서 열렸습니다. 이번 ICML 2026에는 2만4천에 달하는 논문들이 투고되었고 그…

Continue Reading
Posted in X-Diary

2026 상반기 회고

안녕하세요, RCV 연구실 1년차이자, 막내이자, 로보틱스 팀이자, 이제 곧 입대를 하는 김기현입니다. 저도 전혀 생각하지 않고 있었는데 이번 URP 분들을 보니 저도 1년 동안 연구실…

Continue Reading