안녕하세요. 이번에는 Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding 논문을 읽어봤습니다. Emotion-LLaMA라는 emotion reasoning 분야로 획을 그은 논문의 후속 논문인데요. Emotion-LLaMAv2를 베이스라인으로 연구를 진행하고 있어 리뷰로 정리해봤습니다. Emotion-LLaMA의 후속작이다 보니 논문 내내 1편은 이게 부족했고 그래서 이렇게 고쳤다는 이야기가 계속 나옵니다. 그럼 리뷰 시작하겠습니다.
1. Introduction
최근 감정 연구에서는 emotion recognition에서 끝나는 것이 아닌 emotion understanding, emotion reasoning으로 넘어가고 있습니다. 감정 라벨 하나 찍고 끝나는 게 아니라, 그 감정이 왜 생겼고 어떤 맥락에서 나온 것인지까지 같이 추론해야 한다는 겁니다. “이 사람 화났다”에서 멈추지 말고 “말이 빨라지고 눈썹이 찌푸려졌는데 상대가 민감한 질문을 던진 직후다, 그래서 화가 났다”까지 가야 한다는 것이죠.
이게 왜 어렵냐면 사람의 감정 신호가 여러 modality에 흩어져 있는데 그 신호들끼리 시간이 어긋나 있고 상관관계도 약하고 겉으로 안 드러나는 심리적, 환경적 요인의 영향까지 받기 때문입니다. 목소리 운율은 운율대로, 미세 표정은 표정대로, 상황 맥락은 맥락대로 따로 논다고 보시면 될 것 같습니다.
기존 연구 흐름은 대충 이렇습니다. 처음엔 unimodal recognition이었습니다. 얼굴 표정 분석, 음성 감정 탐지, 텍스트 감성 분석이 각각 따로 발전했고요. 그다음 multimodal fusion framework가 나와서 cross-modal attention이나 joint representation learning을 붙였고, 통제된 환경에서는 성능이 꽤 좋아졌습니다. 그런데 저자들이 지적하는 건 이 방법들이 modality 사이의 feature-level correlation만 다룬다는 점입니다. 사람이 감정을 이해하는 방식은 계층적이거든요. 얼굴 움직임이나 억양 같은 낮은 수준 신호에서 출발해서 그걸 해석하고 평가하는 높은 수준으로 올라갑니다. 기존 모델들은 이 계층 자체를 안 만들었다는 겁니다.
그럼 요즘 잘나가는 MLLM을 쓰면 되지 않느냐. 저자들은 안 된다고 보는데요. 이유가 몇 가지 있습니다.
- micro expression이나 여러 감정이 섞인 blended affective state 같은 미세한 시각 단서에 둔감합니다.
- 감정 전용 instruction data가 대규모로 없습니다. 특히 지각과 추론을 같이 묶어놓은 데이터가 없습니다.
- 여러 데이터셋에 걸쳐 일관되게 평가할 표준 benchmark가 없습니다.
여기서 전작인 Emotion-LLaMA가 나오는데요. Emotion-LLaMA는 감정 전용 instruction tuning을 처음 시도한 논문이었는데, 여기서 저자들이 생각한 3가지 문제가 있습니다.
첫째, OpenFace로 얼굴 영역을 잘라내는 전처리에 의존했습니다. 이러면 완전한 end-to-end 학습이 안 되고, 얼굴 검출기가 실수하면 그 오류가 뒤로 계속 전파됩니다.
둘째, 오디오나 시각 표현을 pooled token 하나로 압축했습니다. pooling은 여러 값을 평균 같은 걸로 뭉개는 연산인데, 이 과정에서 시간에 따른 변화와 음향 변화가 그냥 사라집니다. 감정에서 제일 중요한 정보가 날아가는 거죠.
셋째, 학습 데이터인 MERR이 MER2023 하나에서 파생된 거라 규모도 작고 감정 카테고리 간 주석 일관성도 떨어졌습니다.
그래서 v2에서 내놓는 것은 다음과 같습니다.
- end-to-end multi-view encoder. 얼굴 검출기를 아예 빼버리고 감정과 관련된 영역은 모델이 알아서 attention으로 찾게 둡니다. 대신 공간적, 시간적으로 여러 시점의 토큰을 뽑아서 미세한 단서를 잡습니다.
- Conv-Attention pre-fusion module. LLM에 넣기 전에 미리 modality들을 섞어주는 모듈인데 convolution과 attention을 동시에 씁니다. 지역적인 것과 전역적인 것을 같이 보겠다는 의도입니다.
- perception-to-cognition curriculum instruction tuning. 먼저 감정 인식만 가르치고 그다음에 감정 추론을 가르치는 2단계 커리큘럼입니다.
여기에 MMEVerse가 추가되는데요. 12개 데이터셋을 합치고 Qwen2 모델과 GPT-4o를 사용한 multi-agent pipeline으로 전부 다시 annotation하였다고 합니다. 학습용 약 130K, 평가용 36K 클립이 나왔고 전작 MERR 대비 규모가 3배 이상입니다. 그리고 무려! 18개 벤치마크로 구성된 MMEVerse-Bench도 같이 공개하였습니다.
2. MMEVerse
2.1 Data Curation
저자들은 기존 감정 데이터셋에서 비디오, 오디오, 텍스트 스트림이 완전히 동기화된 12개의 데이터셋을 골라 구성하였는데요.

VAD는 감정을 valence, arousal, dominance라는 축의 숫자로 표현하는 방식이고, sentiment의 [-3, 3]은 아주 부정적(-3)부터 아주 긍정적(+3)까지의 연속 점수입니다.
여기서 저자들은 원래 데이터셋에 붙어 있던 categorical emotion label만 남기고 기존 서술형 주석은 전부 버렸다고 합니다. 그리고 모든 클립을 자기들 파이프라인으로 처음부터 다시 annotation 했습니다.
2.2 Annotation Pipeline

이 논문에서 가장 공들인 부분이 여기라고 봅니다. Algorithm 1로 정리되어 있는데 순서대로 따라가 보겠습니다.
입력은 비디오 프레임 $V = f_1, f_2$, $\dots, f_n$, 오디오 스트림 $A$, 그리고 자막입니다.
먼저 peak-frame detection입니다. OpenFace로 모든 프레임에서 Facial Action Unit(AU)을 뽑습니다. AU는 “눈썹을 올린다”, “입꼬리를 내린다” 같은 얼굴 근육 움직임에 번호를 붙여둔 체계인데요. 각 프레임 $f_k$마다 AU 강도를 전부 더합니다.
$S^k_{aui}$가 k번째 프레임에서 i번 AU의 강도이니, $I_{AU}$는 “이 프레임에서 얼굴이 얼마나 크게 움직였나”를 나타내는 숫자 하나가 됩니다. 알고리즘은 이걸 쭉 훑으면서 $I_{AU} > I_{peak}$이면 $I_{peak}$를 갱신하고 그 프레임을 $Frame_{peak}$로 기억합니다. 표정이 가장 크게 드러난 한 장을 골라내는 작업이라고 보시면 되겠습니다!
그다음이 visual clues extraction입니다. 뽑아낸 $Frame_{peak}$를 두 모델에 각각 넣는데요. OpenFace는 AU 기반의 세밀한 근육 움직임 서술을 만들고(이를 $C_{ved}$라고 할 수 있습니다), Qwen2.5-VL-72B는 장면 구성이나 사물, 상호작용 같은 고수준 맥락을 뽑습니다(이를 $C_{vod}$라고 할 수 있습니다). 하나는 미시, 하나는 거시를 담당한다고 보시면 됩니다.
오디오 쪽은 Qwen2-Audio나 Audio-Reasoner로 분석해서 음높이 변화, 말 속도, 세기, 멈춤, 머뭇거림 같은 걸 뽑아 $C_{atd}$를 만듭니다. 자막 $C_{ls}$는 말의 내용에서 오는 맥락을 제공합니다.
마지막으로 $C_{ved}$, $C_{vod}$, $C_{atd}$, $C_{ls}$를 전부 합쳐서 예비로 multimodal emotional description을 만든 뒤 GPT-4o가 이걸 다듬어 최종 $C_{md}$를 만듭니다. 이때 모달리티끼리 서로 모순되는 부분을 정리하는 역할도 합니다. 최종 annotation은 $C_{md}$와 원래의 감정 라벨이고, 일부는 사람이 검증합니다.
2.3 Benchmark Construction
다시 annotation한 샘플들은 MMEVerse-Train과 MMEVerse-Bench로 나뉩니다. 이때 각 원본 데이터셋이 원래 정해둔 train/validation/test 분할을 그대로 지켰다고 하는데, 학습 데이터가 평가에 섞이는 걸 막기 위해서입니다.
또 하나 중요한 결정은 데이터셋마다 다른 감정 분류 체계를 억지로 하나로 통일하지 않고 각자의 native label space를 그대로 뒀다는 점입니다. 통일하려면 서로 호환 안 되는 감정 정의를 손실 있게 매핑해야 하니까요.
최종 벤치마크는 36,133개 클립, 18개 세트입니다.

Unibench 열에 체크가 붙은 9개가 기존 MER-UniBench이고, X인 9개가 이번에 새로 추가된 것입니다. 참고로 OV-Emotion은 open-vocabulary emotion으로, 정해진 라벨 중에 고르는 게 아니라 자유로운 단어로 감정을 표현하는 task입니다.
3. Methodology
3.1 Overview

Figure 1이 전체 구조입니다. 오른쪽 흐름을 아래에서 위로 따라가면 되는데요. 맨 아래에 Image Encoder, Video Encoder, Audio Encoder가 있고 전부 frozen 입니다. 이 출력들이 왼쪽 Conv-Attention Module로 들어가고, 그 위에 projector 네 개짜리 Modal Adapter가 있습니다. 여기는 학습 진행하구요. 여기서 나온 토큰들이 색깔별로 한 줄에 늘어선 뒤 맨 위 LLM으로 들어가고요. LLM은 frozen이고 옆에 붙은 LoRA만 학습합니다.
식으로 쓰면 이렇습니다. $E_a$는 audio encoder, $E_v$는 visual encoder, $F_{av}$는 Conv-Attention pre-fusion module, $\phi$는 LLM이고, 입력이 $P = \langle \text{Audio}, \text{Video}, \text{Prompt} \rangle$일 때 출력은 다음과 같습니다.

길어 보이는데 별거 아닙니다. $\Omega$는 vision pre-processing operator로, 비디오 V를 대표 프레임 한 장과 프레임 시퀀스로 쪼개는 역할입니다. 괄호 안 네 개는 각각 오디오 인코딩 결과, 비디오 인코딩 결과, 둘을 미리 섞은 결과, 텍스트 프롬프트 인코딩 결과고요. 이 넷을 $\phi$가 받아서 최종 텍스트 $\hat{O}$를 뱉습니다. $\hat{O}$는 과제에 따라 감정 라벨일 수도 있고 긴 description 일 수도 있습니다.
프롬프트 템플릿도 구조가 정해져 있습니다.

<FusionFeature>는 미리 섞은 특징, <ImageFeature>는 대표 프레임, <VideoFeature>는 프레임 시퀀스, <AudioFeature>는 오디오입니다. <Text>에 자막이 들어가고 <TaskIdentifier>가 지금이 인식 task인지 추론 task인지를 알려줍니다. 모달리티마다 자리를 따로 둔 것은 LLM이 필요한 토큰만 골라서 볼 수 있게 하기 위해서라고 하네요.
3.2 Multimodal Encoder and Tokenization
오디오는 HuBERT 또는 Whisper를 쓰는데, 이를 통해 억양, 리듬, 에너지 변화 같은 운율 패턴을 담은 u_a가 나옵니다.
시각 파트는 비디오를 두 갈래로 나눠서 각각 다른 인코더에 넣습니다.
- global visual encoder $E^v_{glo}$는 비디오 중간 프레임 한 장만 처리합니다. 짧은 클립에서는 표정이 대체로 중간쯤에 정점을 찍는다는 경험적인 규칙으로 처리한 것인데요. EVA(ViT 기반)를 사전학습 가중치로 초기화해서 씁니다. 결과가 $u^v_{glo} = E^v_{glo}(\text{Frame})$이고, 얼굴 표정과 장면 맥락을 같이 담습니다.
- temporal visual encoder $E^v_{temp}$는 움직임을 담당합니다. 프레임을 균일하게 샘플링해서 넣고요. 저자들은 두 종류를 놓고 고민하는데, VideoMAE 같은 전용 비디오 인코더를 쓸 것이냐 아니면 CLIP 같은 이미지 인코더를 프레임마다 따로 적용하고 나중에 pooling할 것이냐입니다. 결과는 $u^v_{temp} = E^v_{temp}(V)$입니다.
토크나이저는 LLaMA tokenizer를 씁니다. SentencePiece로 구현된 BPE(byte-pair encoding) 방식인데, 자주 붙어 나오는 글자 조각을 하나의 토큰으로 묶는 방법이라 감정 대화에 흔한 비격식 표현이나 감탄사, 말끝 흐린 문장도 잘 처리한다고 합니다.
3.3 Multimodal Pre-fusion with Conv-Attention Module
버전1에서는 fusion을 그냥 LLM한테 맡기는 식으로 구성되었습니다. 구조는 단순했는데 학습이 불안정해지고 모달리티 간 연결이 모호해졌다고 저자들은 말하는데요. AffectGPT 같은 최근 연구는 LLM 바깥에 Q-Former나 단순 attention을 두는 식으로 이 문제를 다뤘는데, 저자들이 보기엔 이것도 문제가 있다고 합니다. pooled representation을 쓰기 때문에 시간 구조와 지역적 변화가 압축되어 날아간다는 겁니다. micro-expression이나 목소리 운율 변화처럼 짧게 스쳐 지나가는 게 감정에서는 제일 중요한데 말이죠.
그래서 나온 게 Conv-Attention module입니다. 아이디어는 간단한데요. convolution과 attention이 가진 서로 다른 성향을 그냥 둘 다 쓰자는 겁니다. 먼저, convolutional branch는 receptive field가 좁아서 짧은 시간 범위의 세밀한 패턴을 잘 잡습니다. attention branch는 시공간적으로 멀리 떨어진 것끼리 연결하는 걸 잘 하도록합니다.

Figure 1 왼쪽 분홍 상자가 이 모듈의 내부입니다. 위에서 MLP를 거쳐 Stack과 Concatenate로 갈라지고, 왼쪽은 Attn-MLP를 지나 $\otimes$로, 오른쪽은 Conv1d와 Switch가 들어간 블록을 X4 반복해서 내려온 뒤, 마지막에 $\oplus$로 만나 $u_{fusion}$이 됩니다.
먼저 MLP로 각 모달리티 feature의 채널 차원을 맞춥니다. 각 feature는 ($\text{batch}, \text{depth}, \text{dim}$) 모양이고요. 그런 다음 두 가지 구조 $F_d$와 $F_s$를 만듭니다.

attention branch는 F_d에 $\mathrm{Attn\_MLP}$($\cdot$)을 적용해서 뎁스를 $F_s$의 길이에 맞춘 다음 곱합니다.

convolutional branch는 $\mathrm{Conv1d}(\cdot)$으로 시작해서 $\mathrm{Switch}(\cdot)$ 활성함수가 붙은 residual block이 여러 개 이어집니다.

오른쪽 항에서 이전 블록 출력 $F^{k-1}_{conv}$를 그대로 더하는 게 residual 구조인데, 원래 값은 보존하고 변화분만 얹는 방식이라 학습이 안정적입니다.
마지막에 $F_{conv}$와 $F_{attn}$을 원소별로 더해서 u_f를 만듭니다.
3.4 Multimodal Alignment with Modal Adapter
오디오, 시각, 융합 feature는 나온 곳이 다 달라서 차원도 다르고 시간 해상도도 다르고 통계적 성질도 다릅니다. 이걸 그냥 LLM에 밀어넣으면 표현이 안 맞거나, 학습이 불안정해지거나, 한 모달리티가 나머지를 압도하는 modality dominance가 생깁니다.
그래서 modal adapter를 둡니다. 공유 projection 하나를 쓰는 대신 모달리티마다 따로 두는 방식인데요. 학습 가능한 선형 사영 집합 $\sigma = \{\sigma_a, \sigma^v_{glo}, \sigma^v_{temp}, \sigma_f\}$를 놓고 다음처럼 씁니다.

projection이 끝나면 토큰들이 프롬프트 템플릿 순서대로 이어붙습니다. $\langle T_a \rangle, \langle T^v_{glo} \rangle, \langle T^v_{temp} \rangle, \langle T_f \rangle, \langle T_{text} \rangle $순입니다.
3.5 The Perception-to-Cognition Training Framework
버전 1은 MERR-Coarse로 사전학습하고 MERR-Fine으로 다듬는 방식으로 진행됐는데요. v2는 사람이 감정을 배우는 순서를 흉내 낸 커리큘럼을 씁니다.
Stage 1은 perception입니다. MMEVerse-Train으로 학습하되 정답으로는 감정 라벨만 씁니다. 데이터에 서술이 붙어 있긴 한데 이 단계에서는 안 쓰고, 그러니까 추론 과정에 대한 supervision은 없는 셈입니다. 지시문은 “Please determine which emotion label in the video represents: ⋆.” 같은 문장이고 ⋆에 그 데이터셋의 감정 목록이 들어갑니다.
Stage 2는 cognition입니다. 이제 인식과 추론을 같이 최적화합니다. 지시문의 경우, reasoning은 <think>와 </think> 안에, 최종 감정은 <answer>와 </answer> 안에 넣으라는 형식입니다. outcome level에서는 감정 카테고리를, process level에서는 증거를 감정으로 연결하는 설명 자체를 supervision 합니다.
4. Experiments
4.1 Main Results

Table 4를 통해 감정 인식 전체 결과를 확인할 수 있습니다. Avg-9는 MER-UniBench 성능과 같고, Avg-18이 MMEVerse-Bench 18개 평균을 의미합니다.
Emotion-LLaMAv2의 성능을 보시게 되면, MER-UniBench와 MMEVerse-Bench 모두에서 SOTA를 달성한 것을 볼 수 있습니다. 이것 외에도 해당 테이블을 보시게 되면, 몇 가지 포인트가 되는 부분이 있는데요. 우선 AffectGPT가 MER-UniBench에서는 강했는데 MMEVerse-Bench의 새 데이터셋에서는 확 떨어집니다. 저자들은 이걸 자기들 벤치마크가 더 넓게 본다는 근거로 쓰는데요. 다만 조심할필요가 있는 것이 MMEVerse-Bench 18개 중 9개는 MMEVerse-Train과 같은 원본 데이터셋에서 나왔습니다. train/test 분할은 지켰지만 학습 분포가 유리한 건 사실이니까요. 일반화 실패로 읽을 수도 있고 분포 차이로 읽을 수도 있는 결과라고 생각이 드네요.
다음으로는, HumanOmni가 DFEW, MAFW, CAER에서 유독 좋은 것을 볼 수 있습니다. 저자들은 이 모델이 GPT-4o로 재구성한 QA annotation으로 딱 그 데이터셋들을 집중 학습했기 때문일 거라고 보는데요. 반대로 multi-label 과제인 MAFW-m과 BOLD는 모두가 못하는 모습을 보입니다. 특히 BOLD는 최고가 9.21인데요. 라벨 체계가 어렵고 아직 잘 안 쓰인다는 뜻이겠죠.
그리고 Stage 2가 항상 좋은 것도 아닌데요. MER-UniBench에서는 78.91(Stage 1)이 78.52(Stage 2)보다 높습니다. 추론 학습은 복잡한 서술을 맞추는 데 초점이 있어서 카테고리 정확도에는 별 도움이 안 된다는 게 저자들 설명입니다. 실용적으로는 인식만 필요하면 Stage 1, 설명까지 필요하면 Stage 2를 쓰라는 얘기가 되겠네요.
다음은 최근 나온 종합 벤치마크인 MME-Emotion입니다. Rec-S는 인식, Rea-S는 추론, CoT-S는 Chain-of-Thought 점수입니다.

Rec-S와 CoT-S는 open source와 closed source를 통틀어 1등입니다. GPT-4o나 Gemini-2.5-Pro보다 높아요. Rea-S는 open source 중 2등이네요.
해당 표에서 흥미로운 부분이 있다면 Emotion-LLaMA의 Rea-S가 0.4, HumanOmni가 0.3인데 Avg Token을 보면 각각 2.3과 1.3입니다. 감정 단어 하나 뱉고 끝냈다는 뜻이죠. 추론을 못한 게 아니라 아예 안 했다고 볼 수 있을 것 같네요. v2는 Avg Step 5.8, Avg Token 184.5로 실제로 여러 단계에 걸쳐 설명을 씁니다. 1버전 대비 성능이 올랐다기보다 출력의 종류 자체가 달라졌다고 보는 게 맞을 것 같습니다.
4.2 Ablation Studies
여기서부터는 ablation을 진행하였는데요.
먼저 Conv-Attention 모듈입니다

Stage 1에서는 효과가 있는데 Stage 2로 가면 +0.16까지 줄어듭니다. 저자들은 복잡한 추론 학습이 pre-fusion의 이득을 어느 정도 상쇄한다고 설명하는데요.
pre-fusion 구조 비교도 있습니다

뭘 넣든 안 넣는 것보다는 나은 것을 볼 수 있는데요. 개별로는 Q-Former와 Conv가 강한데, 저자들은 이걸 pre-fusion 단계에서 local temporal information를 보존하는 게 효과적이던 것이 아닌가 봅니다. 그리고 둘을 합친 Conv-Attn이 제일 좋고요.
다음은 학습 방식 비교입니다

인식과 추론을 처음부터 한꺼번에 학습하면 오히려 확 떨어지는 것을 볼 수 있습니다. Emotion-LLaMAv2에서 했던 방식대로 인지와 추론을 분리하여 학습하는 것이 효과적임을 볼 수 있습니다.
4.3 Qualitative Analysis
Table 12는 추론 비교입니다. 자막은 “Don’t ask why, do you want to eat Peking duck?”이고, 정답은 상대의 민감한 질문에 불쾌해했고 말이 빨랐으며 눈살을 찌푸렸으므로 anger입니다.

표에서 빨강은 잘못된 추론, 파랑은 올바른 추론, 초록은 hallucination입니다. Emotion-LLaMAv2만이 표에서 유일하게 빨강, 초록이 없는 행인데요. 어조, 표정, 장면, 대화 맥락을 차례로 짚고 <answer>angry</answer>를 내는 것을 볼 수 있습니다.

Figure 5는 case study인데요. 왼쪽 초록이 맞힌 것, 오른쪽 분홍이 틀린 것입니다. 각 상자에 자막, 실제 프레임 4장, 모델의 Think: 서술, 그리고 GT와 Pred가 같이 나옵니다.
왼쪽 성공 사례들은 오디오, 비디오, 텍스트가 서로 일치하는 경우입니다. 예를 들어 “There’s like—there’s like 300 bucks in this one!”에서는 문장 끝 올라가는 억양, 빠른 말 속도, 목소리 떨림, 크게 뜬 눈과 벌어진 입, 얼굴 근처 손동작을 다 모아서 surprise를 맞힙니다.
오른쪽 4개가 재밌는 것이 4개 사례모두 Think: 안의 서술이 아주 상세하고 논리적으로 보입니다. 그런데 결론이 틀렸어요. 설명이 길고 구체적이라고 해서 맞는 게 아니라는 걸 보여주는 부분이라 생각듭니다.
감정인식이라 또 구경하러 왔습니다.
저는 우선 논문이 정말 emotion understanding/reasoning을 해결했다고 볼 수 있는지를 중심으로 리뷰를 읽었는데요.
Table 10이 Perception-to-Cognition curriculum의 효과를 보여주려는 목적 같습니다. 그런데 여기선 recognition 성능만 비교하고 있는데, 핵심 목적이 emotion reasoning 향상이라면 EMER의 reasoning score에서도 single joint training과 curriculum training을 비교할 필요가 있지 않을까요? 현재 결과만으로 curriculum 자체가 reasoning capability를 향상시켰다고 볼 수 있을지 궁금하네요!
그리고.. MMEVerse의 reasoning annotation 생성 과정에서 GPT-4o가 ground-truth emotion label을 이미 제공받고 설명을 생성하는데요. 그렇다면 생성된 description이 실제 multimodal evidence로부터 감정을 추론한 reasoning이라기보다, 주어진 정답을 사후적으로 설명하는 rationalization이 될 가능성은 없을까요? 이 supervision으로 학습한 모델의 reasoning capability를 어떻게 검증할 수 있을지 궁금하네요!
안녕하세요. 댓글 감사합니다!
논문의 허점들을 쏙쏙 뽑아서 질문하신 것 같습니다. 저도 주영님의 질문과 비슷한 생각을 하였는데요. 먼저
1) EMER의 reasoning score에서도 single joint training과 curriculum training을 비교할 필요가 않은지? 현재 결과만으로 커리큘럼 자체가 reasoning capability를 향상 시켰다고 볼 수 있는지?
-> 비교가 필요하다고 생각이 들고, 현재 결과만으로는 커리뮬럼이 reasoning을 향상 시켰다라고 보기는 조금 어려운 부분이 있다고 생각합니다. 그 이유가 Table 10에서 커리큘럼 효과를 보여주는데 정작 비교 지표가 recognition 정확도 뿐이여서 EMER이 샘플 수가 너무 적어서 비교하지 못했다고 하더라도 mme-emotion에서만큼은 보여줘야했던 것은 아니었을까 생각이 듭니다. (mme-emotion이 추론을 잘 보여주는 벤치마크이기 때문에!)
2) 주어진 정답을 사후적으로 설명하는 rationalization이 될 가능성은 없는지?
-> 저도 이 부분이 해당 논문의 가장 약점이 되는 부분이 아닌가 생각이 듭니다. 말씀하신 rationlization 가능성이 구조적으로 존재하는데, 제가 리뷰에 가져오지는 않았지만 본 논문의 table 3에 MMEVerse만 유일하게 label-guided description에 체크가 되어 있거든요. 라벨과 설명간의 일관성이 보장된다는 장점을 가지기는 하지만, 말씀하신 대로 GPT-4o 정답을 미리 알고 있으면 라벨에 맞는 단서만 골라 쓰고 모순되는 단서는 걸러내는 경우가 있을 것 같습니다. Figure 5 보시면 실패 샘플 모두 Think 서술은 상세하고 논리적인데 결론만 틀린 것을 볼 수 있습니다. rationlization 학습의 증상이라고 볼 수 있을것 같네요.
이거에 대해서 저도 연구하고 있어서 저 나름대로 검증 방법을 생각해봤는데… counterfactual 테스트를 해보는 것입니다. 오디오를 묵음 처리하거나 얼굴을 가렸을 때 모델이 이용하는 단서랑 결론이 같이 바뀌는 거를 보는건데, 지워진 모달리티의 단서를 여전히 언급하고 있다면 이거는 추론이 아니라 학습때 외운 패턴을 뱉고 있다는 것으로 볼 수 있을 것 같습니다. 현재 주영님이 말씀하신 것을 증명하거나 개선할 수 있는 논문을 보고 있으니 다음 리뷰를 기대해보시면 좋을 것 같네용
감사합니다.
안녕하세요 주연님 좋은 리뷰 감사합니다.
VideoMAE 같은 전용 비디오 인코더를 쓸 것이냐 아니면 CLIP 같은 이미지 인코더를 프레임마다 따로 적용하고 나중에 pooling할 것이냐를 두고 저자가 고민한다고했는데, 결국 어떤걸 사용했는지 궁금합니다.
감사합니다.
안녕하세요. 댓글 감사합니다.
결론적으로 저자들은 이미지 인코더를 프레임마다 적용하는 쪽을 선택해서 진행했습니다. 제가 이 부분에 대해서 디테일하게 언급하지 않았었네요😅 최종 구성은 whisper + EVA(전역 프레임) + EVA(시간 프레임) 이렇게 구성하였습니다.
감사합니다.
안녕하세요 주연님 좋은 리뷰 감사합니다!
annotation pipeline에서 AU 강도를 이용해서 peak-frame을 고르는데, 여기서 AU 강도는 무표정일때 가장 낮은 수치인건가요? 영상에서 표정이 다양하게 변할 수도 있고, 웃다가 무표정이 되는 것이 중요한 정보일 경우도 있을 것 같은데 이런 점에 대한 고려는 없는지 궁금합니다.
감사합니다.