[2026-1기][김은아] 학부개발인턴(UDI)을 마치며
안녕하세요. 2026년 1학기 개발인턴 1기에 참여한 김은아입니다. 앞으로 개발인턴 지원을 고민하시는 분들께 이 글이 도움이 되길 바랍니다. 1. 지원 동기저는 지능기전공학과 3학년을 마치며, 학교 시험과…
[2026-1기][유지원] 학부개발인턴(UDI)을 마치며
안녕하세요. 2026년 1월부터 6월까지 6개월간 UDI 프로그램에 참여한 유지원입니다. RCV 연구실에 UDI 프로그램이 처음 도입된 해에 1기로 참여하게 되었습니다. 제가 경험한 내용이 앞으로 UDI 프로그램…
[arXiv2026] What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems
Intro LLM의 활용 형태중 하나로 MAS(multi agent system)이 활발하게 연구되고 있습니다. 최근 연구는 특히 roles 제안이나 tool 구성 제안과 같은 방식으로 이루어지고 있는데, 에이전트간 소통의…
[Arxiv 2022] Exploring Visual Explanations for Contrastive Language-Image Pre-training
안녕하세요 이번에 들고온 논문은 CLIP 의 Vision 과 Text embedding의 similarity map 이 기대하는 경향성과는 반대라는점을 밝히고 개선한 논문입니다. Abstract 우선 저자는 Contrastive Language-Image Pre-training,…
[CVPR 2026] WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
안녕하세요. 오늘 소개할 논문은 중국의 대표 메신저 기업 WeChat에서 CVPR 2026에 개제한 논문으로, OVOD를 vision-language의 fusion 없이 단순한 retrieval 문제로 재정의한 논문입니다. 1. Introduction 컴퓨터…
[CVPR 2026] Back to Basics: Let Denoising Generative Models Denoise
안녕하세요. 이번 x-review는 최근 이미지 생성 분야에서 큰 주목을 받고 있는 논문인 “Back to Basics: Let Denoising Generative Models Denoise”입니다. MIT의 Tianhong Li와 Kaiming He가…
[ICLR 2026] REI-BENCH: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
안녕하세요. 이번에는 REI-BENCH: Can Embodied Agents Understand Vague Human Instructions in Task Planning?이라는 논문을 읽어보게 되었습니다. 쉽게 말하면, 로봇이 사람이 애매하게 말한 지시를 얼마나 잘…
[ ICLR 2024 ] ANTGPT: CAN LARGE LANGUAGE MODELS HELP LONG-TERM ACTION ANTICIPATION FROM VIDEOS?
안녕하세요. 오늘 리뷰할 논문은 ICLR 2024에 발표된 AntGPT입니다. AntGPT는 영상을 입력 받아 영상 이후에 나올 사람의 행동을 예측하는 long-term action anticipation(이하 LTA) 문제에 대규모 언어…
[CVPR 2026]SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 CVPR 2026에 올라온 SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation라는 논문이고 oral 페이퍼입니다. 이 논문은 제목 그대로 socially-aware…
[ICCV 2025] Principles of Visual Tokens for Efficient Video Understanding
안녕하세요. 이번에 소개할 논문은 Video Understanding에서의 token pruning을 다룬 논문입니다. 이 논문은 video token의 성질을 분석해, 모든 token이 같은 가치를 가지는 것이 아니라 소수의 핵심…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…