Recent Posts
[arXiv 2026] Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation
Introduction 로봇이 이미지를 받아서 주행하는 측면에서 현재 학습 기반 방법론(NoMAD, ViNT)가 충돌없이 잘 주행하는 편입니다. 하지만 진짜 어려운 부분들은 모델이 전부 갈수 있을거 같은 후보를…
[CVPR 2026] Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
안녕하세요. 오늘의 X-Review는 DreamPRVR이라는 PRVR 논문입니다. 최근 저도 PRVR을 연구하면서 frame과 clip 수준의 local matching을 어떻게 개선할지 여러 실험을 진행하고 있는데, DreamPRVR에서 문제를 바라보는 관점이…
[Arxiv 2026] Support×Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions
1. Vision Encoder는 정말 Compositional할까? 최근 DINOv3나 SigLIP2와 같은 Vision Encoder들은 이미지의 객체, 위치, 속성 등 다양한 정보를 상당히 잘 표현한다고 알려져 있습니다. 그렇다면 여기서…
[NeurIPS 2025] Generalized Contrastive Learning for Universal Multimodal Retrieval
안녕하세요 오늘은 NeurIPS 2025에 게재된 Generalized Contrastive Learning for Universal Multimodal Retrieval 논문을 보겠습니다간단히 먼저 설명하자면, 기존 image-text pair만 가지고 image, text, image+text를 하나의 embedding…
[arXiv 2026]FLOW-JEPA: FLOW MATCHING FOR ROBUST LATENTDYNAMICS IN JEPA WORLD MODELS
안녕하세요 손우진입니다. 이번에 리뷰할 논문은 FLOW-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models입니다. 이전에 I-JEPA를 읽으면서 픽셀을 직접 복원하지 않고 representation을 예측한다는…
[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration
본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…
[CVPR 2026] SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
안녕하세요. 이번에는 SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding 논문을 읽어보았습니다. NTU와 NVIDIA 쪽에서 2025년 12월에 올라온 논문인데요. VCD에서…
[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space
안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….
[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…
[arxiv 2025]visual-tactile 6D tracking
안녕하세요 손우진입니다. 이번에 소개드릴 논문은 6D 정보와 Tactile 센서를 활용하여 물체를 조작하는 논문에 대해서 소개드리려 합니다. 특히 로봇이 물체를 잡고 있는 상황에서 발생하는 가림 문제를…
안녕하세요 우진님. 질문 감사합니다 ㅎ 실험은 크게 Grounding과 Navigation으로 나뉩니다. Grounding은 screenshot을 보고 “이 버튼이나 아이콘이 어디 있는지” 좌표를 찾는…