Recent Posts

Posted in Paper X-Review

[CVPR 2026] Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

안녕하세요. 오늘의 X-Review는 DreamPRVR이라는 PRVR 논문입니다. 최근 저도 PRVR을 연구하면서 frame과 clip 수준의 local matching을 어떻게 개선할지 여러 실험을 진행하고 있는데, DreamPRVR에서 문제를 바라보는 관점이…

Continue Reading
Posted in X-Review

[Arxiv 2026] Support×Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions

1. Vision Encoder는 정말 Compositional할까? 최근 DINOv3나 SigLIP2와 같은 Vision Encoder들은 이미지의 객체, 위치, 속성 등 다양한 정보를 상당히 잘 표현한다고 알려져 있습니다. 그렇다면 여기서…

Continue Reading
Posted in Paper X-Review

[NeurIPS 2025] Generalized Contrastive Learning for Universal Multimodal Retrieval

안녕하세요 오늘은 NeurIPS 2025에 게재된 Generalized Contrastive Learning for Universal Multimodal Retrieval 논문을 보겠습니다간단히 먼저 설명하자면, 기존 image-text pair만 가지고 image, text, image+text를 하나의 embedding…

Continue Reading
Posted in X-Review

[arXiv 2026]FLOW-JEPA: FLOW MATCHING FOR ROBUST LATENTDYNAMICS IN JEPA WORLD MODELS

안녕하세요 손우진입니다. 이번에 리뷰할 논문은 FLOW-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models입니다. 이전에 I-JEPA를 읽으면서 픽셀을 직접 복원하지 않고 representation을 예측한다는…

Continue Reading
Posted in Paper X-Review

[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration

본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…

Continue Reading
Posted in X-Review

[CVPR 2026] SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

안녕하세요. 이번에는 SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding 논문을 읽어보았습니다. NTU와 NVIDIA 쪽에서 2025년 12월에 올라온 논문인데요. VCD에서…

Continue Reading
Posted in Paper X-Review

[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space

안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….

Continue Reading
Posted in Paper X-Review

[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…

Continue Reading
Posted in X-Review

[arxiv 2025]visual-tactile 6D tracking

안녕하세요 손우진입니다. 이번에 소개드릴 논문은 6D 정보와 Tactile 센서를 활용하여 물체를 조작하는 논문에 대해서 소개드리려 합니다. 특히 로봇이 물체를 잡고 있는 상황에서 발생하는 가림 문제를…

Continue Reading
Posted in X-Review

[2025 CVPR] CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation

안녕하세요 강희승입니다. 오늘 소개드릴 논문은 CLIP의 text/visual encoder가 각각 first mentioned object, larger object에 대해 bias를 가지고 있고, 해당 bias가 어디서 기원한 것인지 연구한 논문입니다….

Continue Reading