Recent Posts
[CVPR 2026] Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
안녕하세요. 오늘의 X-Review는 DreamPRVR이라는 PRVR 논문입니다. 최근 저도 PRVR을 연구하면서 frame과 clip 수준의 local matching을 어떻게 개선할지 여러 실험을 진행하고 있는데, DreamPRVR에서 문제를 바라보는 관점이…
[Arxiv 2026] Support×Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions
1. Vision Encoder는 정말 Compositional할까? 최근 DINOv3나 SigLIP2와 같은 Vision Encoder들은 이미지의 객체, 위치, 속성 등 다양한 정보를 상당히 잘 표현한다고 알려져 있습니다. 그렇다면 여기서…
[NeurIPS 2025] Generalized Contrastive Learning for Universal Multimodal Retrieval
안녕하세요 오늘은 NeurIPS 2025에 게재된 Generalized Contrastive Learning for Universal Multimodal Retrieval 논문을 보겠습니다간단히 먼저 설명하자면, 기존 image-text pair만 가지고 image, text, image+text를 하나의 embedding…
[arXiv 2026]FLOW-JEPA: FLOW MATCHING FOR ROBUST LATENTDYNAMICS IN JEPA WORLD MODELS
안녕하세요 손우진입니다. 이번에 리뷰할 논문은 FLOW-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models입니다. 이전에 I-JEPA를 읽으면서 픽셀을 직접 복원하지 않고 representation을 예측한다는…
[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration
본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…
[CVPR 2026] SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
안녕하세요. 이번에는 SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding 논문을 읽어보았습니다. NTU와 NVIDIA 쪽에서 2025년 12월에 올라온 논문인데요. VCD에서…
[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space
안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….
[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…
[arxiv 2025]visual-tactile 6D tracking
안녕하세요 손우진입니다. 이번에 소개드릴 논문은 6D 정보와 Tactile 센서를 활용하여 물체를 조작하는 논문에 대해서 소개드리려 합니다. 특히 로봇이 물체를 잡고 있는 상황에서 발생하는 가림 문제를…
[2025 CVPR] CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
안녕하세요 강희승입니다. 오늘 소개드릴 논문은 CLIP의 text/visual encoder가 각각 first mentioned object, larger object에 대해 bias를 가지고 있고, 해당 bias가 어디서 기원한 것인지 연구한 논문입니다….
성민님 좋은 리뷰 감사합니다! 리뷰를 읽으면서 제가 잘 몰랐던 로봇 관련 배경지식도 같이 찾아보게 되어 재미있게 읽었습니다. 제가 이해한 바로는…