Category: X-Review
Paper, Conference, Seminar, API, Code, Dataset 등의 리뷰를 담을 예정입니다.
[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration
본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…
[CVPR 2026] SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
안녕하세요. 이번에는 SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding 논문을 읽어보았습니다. NTU와 NVIDIA 쪽에서 2025년 12월에 올라온 논문인데요. VCD에서…
[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space
안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….
[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…
[arxiv 2025]visual-tactile 6D tracking
안녕하세요 손우진입니다. 이번에 소개드릴 논문은 6D 정보와 Tactile 센서를 활용하여 물체를 조작하는 논문에 대해서 소개드리려 합니다. 특히 로봇이 물체를 잡고 있는 상황에서 발생하는 가림 문제를…
[2025 CVPR] CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
안녕하세요 강희승입니다. 오늘 소개드릴 논문은 CLIP의 text/visual encoder가 각각 first mentioned object, larger object에 대해 bias를 가지고 있고, 해당 bias가 어디서 기원한 것인지 연구한 논문입니다….
[ICML 2026] Model-Aware Contrastive Decoding via Counterfactual Data for Video-LLMs
안녕하세요. 이번에는 MACD: Model-Aware Contrastive Decoding via Counterfactual Data for Video-LLMs 논문을 읽어보았습니다. 생성형AI 과제를 하면서 CD(Contrastive Decoding)이라는 방법론에 관심을 부쩍 가지게 되었는데 해당 방법론을…
[2025 ICLR] SEE WHAT YOU ARE TOLD: VISUAL ATTENTION SINK IN LARGE MULTIMODAL MODELS
안녕하세요 오늘은 ICLR 2025에 게재된 See What You Are Told: Visual Attention Sink in Large Multimodal Models 라는 논문을 보려 합니다. 간단하게 말하자면, LMM에서 실제로는…
[ECCV 2026] Geometric Action Model for Robot Policy Learning
안녕하세요 손우진입니다.오늘 리뷰할 논문은 kaist CVlab 논문인 Geometric Action Model for Robot Policy Learning” 입니다. 사전학습된 geometric foundation model(GFM) 을 그대로 로봇 policy의 backbone으로 재활용?하겠다는…
[CVPR 2025]ShowUI: One Vision-Language-Action Model for GUI Visual Agent
안녕하세요. 오늘의 X-Review는 GUI Agent 방법론인 ShowUI를 소개해드리고자 합니다. 최근 GUI Agent 분야에 관심이 생겨 관련 논문들을 찾아보던 중 읽게 되었으며, 25년도 CVPR에 게재된 논문입니다….
안녕하세요 주연님 좋은 댓글 감사합니다. 우선 생각하신 분석이 제가 논문 읽으면서 느낀것과 같습니다. 즉 저자가 주장하는 camera 시점의 bias 가…