Category: Paper
Paper Review
[ICML 2026] Plug-and-Play Label Map Diffusion for Universal Goal-Oriented Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 ICML 2026에 올라온 Plug-and-Play Label Map Diffusion for Universal Goal-Oriented Navigation이라는 논문입니다. 해당 논문의 핵심 아이디어 같은 경우는 지금까지 리뷰했던…
[ICML2026]VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding
본 논문은 새롭게 수집된 고품질의 QA 밴치마크 데이터셋을 제공하고, 이를 활용하였을때 모델의 성능이 개선됨을 통해 잘 구성된 데이터셋이 모델 성능 개선에 필수 요소임을 드러낸 연구입니다….
[AAAI 2026] Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
Abstract LVLMs 들은 visual 입력들을 dense 한 sequences 들의 패치들로 변환하여 미세한 semantics들을 포착한다고 합니다. 이러한 visual tokens 들은 textual tokens 들과 달리 토큰수가 많고…
[ECCV 2024] PALM : Predicting Actions through Language Models
안녕하세요, 이번에 리뷰할 논문은 action anticipation 이라는 task를 다루는 논문입니다. 창의학기제 논문이 마무리되는대로 본 연구 주제로 넘어갈 예정이라 입문할 겸 해서 읽어보게 되었습니다. Action Anticipation…
[RA-L 2025] GeNIE: A Generalizable Navigation System for In-the-Wild Environments
안녕하세요. 이번에 리뷰로 가져온 논문은 GeNIE: A Generalizable Navigation System for In-the-Wild Environments 라는 논문입니다. 해당 논문은 2025 IROS에서 열린 earth rover challenge라는 대회에서 우승한…
[CVPR 2026] FINER: MLLMs Hallucinate under Fine-grained Negative Queries
안녕하세요 오늘은 MLLM의 fine grained hallucination과 관련된 FINER논문을 읽어봤습니다CVPR 2026 oral논문이고 MLLM 모델이 이미지 속의 시각적인 정보와 텍스트를 real로 세밀하게 맞춰 보고 있는지! 라는 문제의식이…
[ArXiv 2026]From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation 라는 논문 입니다. 간단하게 컨셉만 설명을 드리면 논문 제목처럼…
[Arxiv 2022] Exploring Visual Explanations for Contrastive Language-Image Pre-training
안녕하세요 이번에 들고온 논문은 CLIP 의 Vision 과 Text embedding의 similarity map 이 기대하는 경향성과는 반대라는점을 밝히고 개선한 논문입니다. Abstract 우선 저자는 Contrastive Language-Image Pre-training,…
[CVPR 2026]SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 CVPR 2026에 올라온 SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation라는 논문이고 oral 페이퍼입니다. 이 논문은 제목 그대로 socially-aware…
[arXiv2025]Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything
본 논문은 특별한 학습없이 다양한 모달리티의 foundation model을 에이전트 구조로 통합하여 모달리티 통합 시스템(omni-modal reasoning)을 세팅할 수 있음을 보인 연구입니다. 본 내용에 대해서는 이어서 더욱…
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…