Recent Posts
[ArXiv 2026]AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration
본 논문은 언어 에이전트의 동적 설계에 관한 것입니다. 현존하는 에이전틱 디자인은 설계에 있어 sub agent의 규칙등이 미리 설계되는 등 추상화 관점에서 동적인 설계 능력은 완벽하지…
[CVPR 2026] SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
안녕하세요. 이번에는 SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding 논문을 읽어보았습니다. NTU와 NVIDIA 쪽에서 2025년 12월에 올라온 논문인데요. VCD에서…
[COLM 2025] Training Large Language Model to Reason in a Continuous Latent Space
안녕하세요. 이번에는 Coconut이라고 불리는 논문을 읽어보았습니다. COLM 이라는 학회에 붙어서 어색해보일 수 있는데, 24년도에 생긴 꽤나 높은수준의 학회인 것 같습니다. 애초에 논문도 Meta 논문이긴 합니다….
[arXiv 2026] ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
안녕하세요. 이번에 리뷰로 가져온 논문은 ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation입니다. 일단 이 논문이 해결하려는 문제를 간단하게 말하면, 지금까지…
[arxiv 2025]visual-tactile 6D tracking
안녕하세요 손우진입니다. 이번에 소개드릴 논문은 6D 정보와 Tactile 센서를 활용하여 물체를 조작하는 논문에 대해서 소개드리려 합니다. 특히 로봇이 물체를 잡고 있는 상황에서 발생하는 가림 문제를…
[2025 CVPR] CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
안녕하세요 강희승입니다. 오늘 소개드릴 논문은 CLIP의 text/visual encoder가 각각 first mentioned object, larger object에 대해 bias를 가지고 있고, 해당 bias가 어디서 기원한 것인지 연구한 논문입니다….
2026년 상반기 회고 – 조성민
안녕하세요. 조성민입니다.RCV 연구실에 합류한 지도 벌써 6개월이 지났네요. 처음 연구실에 들어왔을 때는 모든 것이 낯설었는데, 어느덧 상반기를 돌아보는 회고를 작성하게 되었습니다. 상반기 활동 연구실에 합류한…
[ICML 2026] Model-Aware Contrastive Decoding via Counterfactual Data for Video-LLMs
안녕하세요. 이번에는 MACD: Model-Aware Contrastive Decoding via Counterfactual Data for Video-LLMs 논문을 읽어보았습니다. 생성형AI 과제를 하면서 CD(Contrastive Decoding)이라는 방법론에 관심을 부쩍 가지게 되었는데 해당 방법론을…
[2025 ICLR] SEE WHAT YOU ARE TOLD: VISUAL ATTENTION SINK IN LARGE MULTIMODAL MODELS
안녕하세요 오늘은 ICLR 2025에 게재된 See What You Are Told: Visual Attention Sink in Large Multimodal Models 라는 논문을 보려 합니다. 간단하게 말하자면, LMM에서 실제로는…
[ECCV 2026] Geometric Action Model for Robot Policy Learning
안녕하세요 손우진입니다.오늘 리뷰할 논문은 kaist CVlab 논문인 Geometric Action Model for Robot Policy Learning” 입니다. 사전학습된 geometric foundation model(GFM) 을 그대로 로봇 policy의 backbone으로 재활용?하겠다는…
안녕하세요 인택님 리뷰 감사합니다. LLM 의 thinking과정을 ㅣatent에서 수행한다는게 흥미로운데 따로 CoT처럼 학습은 하지않고 latent 에서 그냥 다음스텝하고 그런건가요 ?…