Author: 황 유진
ICML 2026 참관기
금해 감사하게도 7월 6일부터 11일까지 6일간 개최된 ICML에 참석할 수 있게 되었습니다. 올해 ICML은 기존 제출 논문의 2배에 달하는 논문이 제시되며 수량적으로 큰 변화를 맞이한…
[ICML2026]VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding
본 논문은 새롭게 수집된 고품질의 QA 밴치마크 데이터셋을 제공하고, 이를 활용하였을때 모델의 성능이 개선됨을 통해 잘 구성된 데이터셋이 모델 성능 개선에 필수 요소임을 드러낸 연구입니다….
[arXiv2026] What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems
Intro LLM의 활용 형태중 하나로 MAS(multi agent system)이 활발하게 연구되고 있습니다. 최근 연구는 특히 roles 제안이나 tool 구성 제안과 같은 방식으로 이루어지고 있는데, 에이전트간 소통의…
[arXiv2025]Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything
본 논문은 특별한 학습없이 다양한 모달리티의 foundation model을 에이전트 구조로 통합하여 모달리티 통합 시스템(omni-modal reasoning)을 세팅할 수 있음을 보인 연구입니다. 본 내용에 대해서는 이어서 더욱…
[arxiv2026] Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets
최근 다양한 도메인에서 멀티 에이전트가 도입되고 있습니다. 다양한 페르소나 부여를 통한 전문가 간의 비교나 작업을 분업하는등 다양한 방식으로 활용되고는 하며, 실제로 멀티 에이전트 도입으로 유의미한…
[arXiv2026] Does Your Reasoning Model Implicitly Know When to Stop Thinking?
thinking은 large reasoning model(LRM)이 답변을 할 때, 추론의 과정을 나열하게 하여 응답의 정확도를 높이는 추론 기법입니다. 그러나 너무 장황하게 늘어놓는다거나 기존의 내용을 반복하는등의 문제가 발생하곤…
[NeurIPS 2025] Debate or Vote, Which Yields Better Decisions in Multi-Agent Large Language Models?
본 연구는 7개의 NLP 벤치마크에서 다수결 투표만으로 multi-agent debate(MAD)성능 향상을 대부분 설명할 수 있음을 발견한 연구이다. 고수준 추론이 발생하는 인간 집단(법정)에서는 reflect, revise, converge 과정이…
[arXiv2025]Latent Collaboration in Multi-Agent Systems
멀티 에이전트간 빠르고 효율적인 소통 방법(MAS, multi-agent systems)을 제안한 연구를 소개하겠습니다. 본 연구는 에이전트간에 latent space에서 소통하였을때 효율 증가를 보이고 있습니다. Figure1에서 보면 제안한 latentMAS가…
[arXiv]On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
안녕하세요. 오늘은 지난번 세미나에서 소개해 드린 강화학습에서의 entropy dynamic을 정리한 논문을 소개해 드리려고 합니다. 지난번 세미나에서는 제가 설명을 너무 어렵게 드렸는데요. 오늘은 세미나에서 받은 질문을…
[arXiv2023]VideoChat🦜: Chat-Centric Video Understanding
무언가를 이해한다는것은 어떻게 정의할 수 있을까요? 저는 특정 콘텐츠에 대한 이해는 이해 주체의 관점에 따른다고 생각해왔습니다. 이러한 제 관점에 알맞은 논문을 발견하게 되어 리뷰를 하게…
Q1. k-means 실험의 목적? >> DINOv2+k-means와 DINOv2+CA는 DINOSAURv2의 장점이 단순히 token을 줄였기 때문인지 확인하는 비교 실험입니다. 아마 리뷰어가 "그냥 토큰…