Recent Posts

Posted in Paper X-Review

[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration

본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…

Continue Reading
Posted in X-Review

[CVPR 2026] SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

안녕하세요. 이번에는 SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding 논문을 읽어보았습니다. NTU와 NVIDIA 쪽에서 2025년 12월에 올라온 논문인데요. VCD에서…

Continue Reading
Posted in Paper X-Review

[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space

안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….

Continue Reading
Posted in Paper X-Review

[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…

Continue Reading
Posted in X-Review

[arxiv 2025]visual-tactile 6D tracking

안녕하세요 손우진입니다. 이번에 소개드릴 논문은 6D 정보와 Tactile 센서를 활용하여 물체를 조작하는 논문에 대해서 소개드리려 합니다. 특히 로봇이 물체를 잡고 있는 상황에서 발생하는 가림 문제를…

Continue Reading
Posted in X-Review

[2025 CVPR] CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation

안녕하세요 강희승입니다. 오늘 소개드릴 논문은 CLIP의 text/visual encoder가 각각 first mentioned object, larger object에 대해 bias를 가지고 있고, 해당 bias가 어디서 기원한 것인지 연구한 논문입니다….

Continue Reading
Posted in M.S. X-Diary

2026년 상반기 회고 – 조성민

안녕하세요. 조성민입니다.RCV 연구실에 합류한 지도 벌써 6개월이 지났네요. 처음 연구실에 들어왔을 때는 모든 것이 낯설었는데, 어느덧 상반기를 돌아보는 회고를 작성하게 되었습니다. 상반기 활동 연구실에 합류한…

Continue Reading
Posted in X-Review

[ICML 2026] Model-Aware Contrastive Decoding via Counterfactual Data for Video-LLMs

안녕하세요. 이번에는 MACD: Model-Aware Contrastive Decoding via Counterfactual Data for Video-LLMs 논문을 읽어보았습니다. 생성형AI 과제를 하면서 CD(Contrastive Decoding)이라는 방법론에 관심을 부쩍 가지게 되었는데 해당 방법론을…

Continue Reading
Posted in Paper X-Review

[2025 ICLR] SEE WHAT YOU ARE TOLD: VISUAL ATTENTION SINK IN LARGE MULTIMODAL MODELS

안녕하세요 오늘은 ICLR 2025에 게재된 See What You Are Told: Visual Attention Sink in Large Multimodal Models 라는 논문을 보려 합니다. 간단하게 말하자면, LMM에서 실제로는…

Continue Reading
Posted in X-Review

[ECCV 2026] Geometric Action Model for Robot Policy Learning

안녕하세요 손우진입니다.오늘 리뷰할 논문은 kaist CVlab 논문인 Geometric Action Model for Robot Policy Learning” 입니다. 사전학습된 geometric foundation model(GFM) 을 그대로 로봇 policy의 backbone으로 재활용?하겠다는…

Continue Reading