Author: 김 정우
[ICRA 2025] Dual-BEV Nav: Dual-layer BEV-based Heuristic Path Planning for Robotic Navigation in Unstructured Outdoor Environments
Introduction 여전히 저자들은 로봇이 path planning을 잘못하고 있다고 시작합니다. 먼저 local한 path planning 관점에서는 outdoor의 변화무쌍한 환경으로 인해 traversability map을 제대로 감지 못한다고 합니다. 이를…
ICML 2026 참관기
안녕하세요 이번 26.07.07 – 26.07.09에 ICML 2026에 참관한 후기를 적어보고자 합니다.이번 ICML은 운이 좋게도 학교에서 거리가 가까운 코엑스에서 열려 다녀오기도 수월하였습니다. ICML에 들어가자마자 느낀점은 사람이…
[ICCV 2023] VAD: Vectorized Scene Representation for Efficient Autonomous Driving
Introduction 자율주행을 하기 위해서는 먼저 주변의 환경을 인식하고, 미래의 움직임을 예측하고, 이를 토대로 내가 어떻게 갈지 계획해야합니다. 이 논문 이전에 유명한 자율주행 방법론을 한번 살펴봅시다(UniAD,…
[CVPR 2024] BoQ: A Place is Worth a Bag of Learnable Queries
안녕하세요 다시 Visual Place Recognition 논문으로 돌아왔습니다. 오늘 소개할 논문은 Learnable Query를 이용하여 VPR을 진행하는 논문입니다. 정말 간단한 구조로 이루어져 있지만 높은 성능을 달성하였습니다. 시작해보겠습니다….
[CVPR 2026] EgoX: Egocentric Video Generation from a Single Exocentric Video
안녕하세요 오늘은 위 영상처럼 3인칭 영상을 1인칭 영상으로 만들어주는 논문을 가져왔습니다.시각적 결과가 인상깊어서 어떻게 했나 궁금해서 한번 읽어봤습니다. Introduction 1인칭 시점 영상을 만드는 것을 쉽지…
[ICLR 2024] Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
오늘은 흔히 SelaVPR(Seamless Adaptation)로 불리는 VPR 방법론을 들고 왔습니다. DINOv2를 VPR에 쓰기 시작한 시기에 나와서 효과적으로 Foundation model을 VPR에 활용하는법을 제시한 논문입니다. 저자는 역시 Lu…
[CVPR 2024] CricaVPR: Cross-image Correlation-aware Representation Learning for Visual Place Recognition
안녕하세요. 이번 리뷰는 CricaVPR(CRoss Image Correlation-Aware)입니다. 저자는 현재 VPR에서 혼자 SOTA를 찍고 부수고를 스스로 반복하는 Lu Feug입니다. CricaVPR은 그 중에서도 가장 많은 인용수를 달성한 논문입니다….
[CVPR 2024] Optimal Transport Aggregation for Visual Place Recognition
Introduction VPR에서는 이미지를 apperance pattern descriptor로 설명합니다. 결국 VPR를 잘 수행하기 위해서는 이미지마다 구분력 있는 descriptor를 추출하는 것이 중요합니다. 이를 위해서는 변화하는 조명, 이동, 시간에…
[NeurIPS 2025] Towards Implicit Aggregation: Robust Image Representation for Place Recognition in the Transformer Era
안녕하세요 오늘 리뷰할 논문은 Visual Place Recognition에서 현재 SOTA를 달성하고 있는 Towards Implicit Aggregation(이하 ImAge)입니다. 논문의 제목에서도 Transformer Era에서의 Place Recognition이라고 달아둘 정도로 아주 깔끔하면서…
[IJCV 2025] Masked Channel Modeling for Bootstrapping Visual Pre-training
Introduction Foundation model(e.g. CLIP)의 등장 이후의 model은 엄청난 성능과 일반화 능력을 가지게 되었습니다. 하지만 개인 수준에서 foundation model처럼 대용량의 데이터셋으로 학습시키는건 불가능에 가깝습니다. 그렇기에 결국…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…