Recent Posts

Posted in X-Review

[arXiv 2026] From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

안녕하세요 오늘은 이미지에서 주행가능맵을 뽑아내는 논문을 가져왔습니다.이동체 입장에서 주행가능영역을 그 자체로 이동가능한 지도가 됩니다. 한 이미지에서 주행가능영역을 segment한 후에, BEV(Bird-Eye View)로 변환한다면, 로봇이 어느 영역은…

Continue Reading
Posted in X-Review

[AAAI 2025] OV-DQUO: Open-Vocabulary DETR with Denoising Text Query Training and Open-World Unknown Objects Supervision

1. Introduction OVOD(Open-Vocabulary Object Detection)은 학습 중에 보지 못한 novel category를 잘 탐지하는 것이 중요합니다. 대규모 이미지-텍스트 쌍으로 학습된 CLIP과 같은 VLM이 zero-shot image classification에서…

Continue Reading
Posted in X-Review

[CVPR2026] A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

오늘 소개드릴 논문은 cvpr 2026에 발표된 long video reasoning 관련 논문입니다. 특히 멀티 에이전트 시스템을 활용한 해결책을 제시한 논문입니다. 저에게 본 논문의 전반적인 느낌은, 앞서…

Continue Reading
Posted in X-Review

[MM 2026] Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning

안녕하세요. 이번에는 Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning 논문을 읽어보았습니다. ACM MM Oral 논문인데요. 사람이 감정을 표현할 때 표정과 목소리가 서로 다른…

Continue Reading
Posted in X-Review

[IROS 2026]Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

오늘은 IROS2026에 붙은 열화상 RGB VFM에서의 representation 정렬관점에 연구입니다. 최근 IROS accept 논문을 보다가 제가 관심있는 영역의 논문이 나와 보게 되었습니다 Introduction 열화상 카메라는 모두가…

Continue Reading
Posted in Paper X-Review

[RA-L 2026]From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

안녕하세요. 이번에 리뷰로 가져온 논문은 From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection이라는 논문입니다. 해당 논문의 핵심은 엄청 간단한데 플래닝 모듈이 여러…

Continue Reading
Posted in X-Review

[ICLR 2026] Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training

이번에 리뷰하려는 페이퍼는 텍스트로만 학습된 LLM이 이미지를 전혀 보지 않고도 시각적 사전 지식인 Visual Priors 를 이미 가지고 있다는 것을 밝힌 논문입니다. 1. 이미지 없이,…

Continue Reading
Posted in X-Review

[CVPR 2026] An Empirical Study on How Video-LLMs Answer Video Questions

1. Introduction 최근 Video-LLM은 단순히 이미지 한 장을 이해하는 것을 넘어, 여러 프레임으로 구성된 비디오의 내용을 이해하고 다양한 형태의 질문에 답할 수 있을 정도로 빠르게…

Continue Reading
Posted in Paper X-Review

[arXiv 2025] SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Abstract 안녕하세요, 강희승입니다. 오늘은 지난주에 리뷰한 SigLIP의 후속 연구로, Google DeepMind에서 발표한 SigLIP2를 리뷰해보려고 합니다. SigLIP의 경우, Memory efficiency, 모델의 확장성, 학습 과정에서 효율성 등의…

Continue Reading
Posted in X-Review

[AAAI 2026] Endowing Vision-Language Models with System 2 Thinking for Fine-Grained Visual Recognition

Abstract VLMs는 query 이미지에서 주요한 시각적 특징을 추출하는 능력이 뛰어나지만, fine-grained 시나리오에서는 미묘한 차이를 식별하는 데 어려움을 겪습니다. 저자들은 인간의 “System 1 & System 2”…

Continue Reading