Recent Posts
[arXiv 2022] Video Diffusion Models
안녕하세요, 이번 리뷰는 video generation에 입문하고자 기초부터 다잡기 위해 읽게 된 논문입니다. GAN, VAE(Variational AutoEncoder) 등의 생성 모델에 기반하던 video generation에 diffusion을 처음으로(?) 적용시킨 연구입니다….
[CoRL 2025] Long Range Navigator (LRN): Extending robot planning horizons beyond metric maps
Introduction 로봇이 네비게이션을 할 때는 Global goal이 필요합니다. 그러나 저자는 prior(예를 들어, 위성지도)를 믿을 수 없을 때, 어떻게 해야할지에 대해 얘기를 시작합니다. 저자는 이러한 central…
2026 상반기 회고
안녕하세요 황찬미 입니다. 어느덧 벌써 2026년의 절반이나 지났네요! 매번 시간이 참 빠르다고 생각하는데 이번 상반기는 개인적으로 유독 더 빨랐던 것 같습니다. [2026년 상반기를 보내며] 작년…
[EMNLP 2025] ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
안녕하세요. 이번에는 ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration 논문을 읽어보았습니다. 요즘 MLLM 추론 연구가 죄다 “텍스트를 더 길게 생각하게…
[CVPR 2025] Assessing and Learning Alignment of Unimodal Vision and Language Models
오늘은 조금 흥미로운 논문이 있어 읽어보았습니다. 많은 논문들이 택하는 CLIP에 DINOv2를 보조적으로 붙이는 방식에서 벗어나, DINOv2 자체를 Language space와 직접, 그리고 매우 효율적으로 정렬하는 방법을…
[arXiv 2026] From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments
안녕하세요 오늘은 이미지에서 주행가능맵을 뽑아내는 논문을 가져왔습니다.이동체 입장에서 주행가능영역을 그 자체로 이동가능한 지도가 됩니다. 한 이미지에서 주행가능영역을 segment한 후에, BEV(Bird-Eye View)로 변환한다면, 로봇이 어느 영역은…
[AAAI 2025] OV-DQUO: Open-Vocabulary DETR with Denoising Text Query Training and Open-World Unknown Objects Supervision
1. Introduction OVOD(Open-Vocabulary Object Detection)은 학습 중에 보지 못한 novel category를 잘 탐지하는 것이 중요합니다. 대규모 이미지-텍스트 쌍으로 학습된 CLIP과 같은 VLM이 zero-shot image classification에서…
[CVPR2026] A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
오늘 소개드릴 논문은 cvpr 2026에 발표된 long video reasoning 관련 논문입니다. 특히 멀티 에이전트 시스템을 활용한 해결책을 제시한 논문입니다. 저에게 본 논문의 전반적인 느낌은, 앞서…
[MM 2026] Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
안녕하세요. 이번에는 Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning 논문을 읽어보았습니다. ACM MM Oral 논문인데요. 사람이 감정을 표현할 때 표정과 목소리가 서로 다른…
[IROS 2026]Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision
오늘은 IROS2026에 붙은 열화상 RGB VFM에서의 representation 정렬관점에 연구입니다. 최근 IROS accept 논문을 보다가 제가 관심있는 영역의 논문이 나와 보게 되었습니다 Introduction 열화상 카메라는 모두가…
안녕하세요 정우님, 좋은 리뷰 감사합니다. 비디오를 역방향으로 트래킹하여 목적지가 가려지기 직전 프레임을 affordable frontier로 라벨링한다고 이해했는데, 이때 역방향 트래킹 시…