Recent Posts

Posted in X-Review

[arXiv 2022] Video Diffusion Models

안녕하세요, 이번 리뷰는 video generation에 입문하고자 기초부터 다잡기 위해 읽게 된 논문입니다. GAN, VAE(Variational AutoEncoder) 등의 생성 모델에 기반하던 video generation에 diffusion을 처음으로(?) 적용시킨 연구입니다….

Continue Reading
Posted in X-Review

[CoRL 2025] Long Range Navigator (LRN): Extending robot planning horizons beyond metric maps

Introduction 로봇이 네비게이션을 할 때는 Global goal이 필요합니다. 그러나 저자는 prior(예를 들어, 위성지도)를 믿을 수 없을 때, 어떻게 해야할지에 대해 얘기를 시작합니다. 저자는 이러한 central…

Continue Reading
Posted in M.S. X-Diary

2026 상반기 회고

안녕하세요 황찬미 입니다. 어느덧 벌써 2026년의 절반이나 지났네요! 매번 시간이 참 빠르다고 생각하는데 이번 상반기는 개인적으로 유독 더 빨랐던 것 같습니다. [2026년 상반기를 보내며] 작년…

Continue Reading
Posted in X-Review

[EMNLP 2025] ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration

안녕하세요. 이번에는 ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration 논문을 읽어보았습니다. 요즘 MLLM 추론 연구가 죄다 “텍스트를 더 길게 생각하게…

Continue Reading
Posted in Conference X-Review

[CVPR 2025] Assessing and Learning Alignment of Unimodal Vision and Language Models

오늘은 조금 흥미로운 논문이 있어 읽어보았습니다. 많은 논문들이 택하는 CLIP에 DINOv2를 보조적으로 붙이는 방식에서 벗어나, DINOv2 자체를 Language space와 직접, 그리고 매우 효율적으로 정렬하는 방법을…

Continue Reading
Posted in X-Review

[arXiv 2026] From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

안녕하세요 오늘은 이미지에서 주행가능맵을 뽑아내는 논문을 가져왔습니다.이동체 입장에서 주행가능영역을 그 자체로 이동가능한 지도가 됩니다. 한 이미지에서 주행가능영역을 segment한 후에, BEV(Bird-Eye View)로 변환한다면, 로봇이 어느 영역은…

Continue Reading
Posted in X-Review

[AAAI 2025] OV-DQUO: Open-Vocabulary DETR with Denoising Text Query Training and Open-World Unknown Objects Supervision

1. Introduction OVOD(Open-Vocabulary Object Detection)은 학습 중에 보지 못한 novel category를 잘 탐지하는 것이 중요합니다. 대규모 이미지-텍스트 쌍으로 학습된 CLIP과 같은 VLM이 zero-shot image classification에서…

Continue Reading
Posted in X-Review

[CVPR2026] A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

오늘 소개드릴 논문은 cvpr 2026에 발표된 long video reasoning 관련 논문입니다. 특히 멀티 에이전트 시스템을 활용한 해결책을 제시한 논문입니다. 저에게 본 논문의 전반적인 느낌은, 앞서…

Continue Reading
Posted in X-Review

[MM 2026] Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning

안녕하세요. 이번에는 Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning 논문을 읽어보았습니다. ACM MM Oral 논문인데요. 사람이 감정을 표현할 때 표정과 목소리가 서로 다른…

Continue Reading
Posted in X-Review

[IROS 2026]Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

오늘은 IROS2026에 붙은 열화상 RGB VFM에서의 representation 정렬관점에 연구입니다. 최근 IROS accept 논문을 보다가 제가 관심있는 영역의 논문이 나와 보게 되었습니다 Introduction 열화상 카메라는 모두가…

Continue Reading