Category: Paper

Paper Review

Posted in Paper X-Review

[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration

본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…

Continue Reading
Posted in Paper X-Review

[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space

안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….

Continue Reading
Posted in Paper X-Review

[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…

Continue Reading
Posted in Paper X-Review

[2025 ICLR] SEE WHAT YOU ARE TOLD: VISUAL ATTENTION SINK IN LARGE MULTIMODAL MODELS

안녕하세요 오늘은 ICLR 2025에 게재된 See What You Are Told: Visual Attention Sink in Large Multimodal Models 라는 논문을 보려 합니다. 간단하게 말하자면, LMM에서 실제로는…

Continue Reading
Posted in Paper X-Review

[ICCV 2025] Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation

이전 연구주제에서 이제 새로운 연구주제를 서베이 하면서 이것저것 읽어보다가 간단하게 리뷰해볼만 task를 찾아서 리뷰하게 되었습니다. 이번에 리뷰할 논문은 VLM의 perspective-aware spatial reasoning, 그중에서도 Allocentric spatial…

Continue Reading
Posted in Paper X-Review

[RSS 2026] OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

안녕하세요. 이번에 리뷰로 가져온 논문은 OpenFrontier: General Navigation with Visual-Language Grounded Frontiers라는 논문입니다. 일단 태스크 자체는 object goal navigation으로 텍스트로 object goal 을 넣어주면 주어진…

Continue Reading
Posted in Paper X-Review

[RA-L 2026]From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

안녕하세요. 이번에 리뷰로 가져온 논문은 From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection이라는 논문입니다. 해당 논문의 핵심은 엄청 간단한데 플래닝 모듈이 여러…

Continue Reading
Posted in Paper X-Review

[arXiv 2025] SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Abstract 안녕하세요, 강희승입니다. 오늘은 지난주에 리뷰한 SigLIP의 후속 연구로, Google DeepMind에서 발표한 SigLIP2를 리뷰해보려고 합니다. SigLIP의 경우, Memory efficiency, 모델의 확장성, 학습 과정에서 효율성 등의…

Continue Reading
Posted in Paper X-Review

[ICCV 2023] Sigmoid Loss for Language Image Pre-Training

Prologue 안녕하세요. 강희승입니다. 이번에는 SigLIP입니다. 기초교육 간 읽은 논문 중 최대한 X-review에 작성되지 않은 논문들을 리뷰해보려고 합니다. SigLIP도 최근 자주 쓰이는 Visual Backbone으로 알고 있는데,…

Continue Reading
Posted in Paper X-Review

[2026 ECCV] Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision Language Models

안녕하세요! 최근 VLM들은 이미지의 전반적인 내용은 꽤 잘 이해하지만, 막상 아주 작은 디테일을 확인하거나 이미지의 여러 위치에 흩어진 정보를 함께 봐야 하는 문제에서는 여전히 어려움을…

Continue Reading