Posted in B.S. X-Diary

[2026-1기][김은아] 학부개발인턴(UDI)을 마치며

안녕하세요. 2026년 1학기 개발인턴 1기에 참여한 김은아입니다. 앞으로 개발인턴 지원을 고민하시는 분들께 이 글이 도움이 되길 바랍니다. 1. 지원 동기저는 지능기전공학과 3학년을 마치며, 학교 시험과…

Continue Reading
Posted in B.S. X-Diary

[2026-1기][유지원] 학부개발인턴(UDI)을 마치며

안녕하세요. 2026년 1월부터 6월까지 6개월간 UDI 프로그램에 참여한 유지원입니다. RCV 연구실에 UDI 프로그램이 처음 도입된 해에 1기로 참여하게 되었습니다. 제가 경험한 내용이 앞으로 UDI 프로그램…

Continue Reading
Posted in X-Review

[arXiv2026] What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems

Intro LLM의 활용 형태중 하나로 MAS(multi agent system)이 활발하게 연구되고 있습니다. 최근 연구는 특히 roles 제안이나 tool 구성 제안과 같은 방식으로 이루어지고 있는데, 에이전트간 소통의…

Continue Reading
Posted in Paper X-Review

[Arxiv 2022] Exploring Visual Explanations for Contrastive Language-Image Pre-training

안녕하세요 이번에 들고온 논문은 CLIP 의 Vision 과 Text embedding의 similarity map 이 기대하는 경향성과는 반대라는점을 밝히고 개선한 논문입니다. Abstract 우선 저자는 Contrastive Language-Image Pre-training,…

Continue Reading
Posted in X-Review

[CVPR 2026] WeDetect: Fast Open-Vocabulary Object Detection as Retrieval

안녕하세요. 오늘 소개할 논문은 중국의 대표 메신저 기업 WeChat에서 CVPR 2026에 개제한 논문으로, OVOD를 vision-language의 fusion 없이 단순한 retrieval 문제로 재정의한 논문입니다. 1. Introduction 컴퓨터…

Continue Reading
Posted in X-Review

[CVPR 2026] Back to Basics: Let Denoising Generative Models Denoise

안녕하세요. 이번 x-review는 최근 이미지 생성 분야에서 큰 주목을 받고 있는 논문인 “Back to Basics: Let Denoising Generative Models Denoise”입니다. MIT의 Tianhong Li와 Kaiming He가…

Continue Reading
Posted in X-Review

[ICLR 2026] REI-BENCH: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

안녕하세요. 이번에는 REI-BENCH: Can Embodied Agents Understand Vague Human Instructions in Task Planning?이라는 논문을 읽어보게 되었습니다. 쉽게 말하면, 로봇이 사람이 애매하게 말한 지시를 얼마나 잘…

Continue Reading
Posted in X-Review

[ ICLR 2024 ] ANTGPT: CAN LARGE LANGUAGE MODELS HELP LONG-TERM ACTION ANTICIPATION FROM VIDEOS?

안녕하세요. 오늘 리뷰할 논문은 ICLR 2024에 발표된 AntGPT입니다. AntGPT는 영상을 입력 받아 영상 이후에 나올 사람의 행동을 예측하는 long-term action anticipation(이하 LTA) 문제에 대규모 언어…

Continue Reading
Posted in Paper X-Review

[CVPR 2026]SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

안녕하세요. 이번에 리뷰로 가져온 논문은 CVPR 2026에 올라온 SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation라는 논문이고 oral 페이퍼입니다. 이 논문은 제목 그대로 socially-aware…

Continue Reading
Posted in X-Review

[ICCV 2025] Principles of Visual Tokens for Efficient Video Understanding

안녕하세요. 이번에 소개할 논문은 Video Understanding에서의 token pruning을 다룬 논문입니다. 이 논문은 video token의 성질을 분석해, 모든 token이 같은 가치를 가지는 것이 아니라 소수의 핵심…

Continue Reading