情绪识别里,把脑电(EEG)和语音简单凑在一起用,居然比只靠其中一样效果还差——这是arXiv上一篇cs.LG方向论文给出的反常识结论。
简单融合为啥反而拖后腿?
现在多模态情绪识别(MER)挺流行,把内部神经信号(EEG)和外部语音表情当两个互补的“情绪视图”,听起来逻辑顺:既有生理层面的真实反应,又有外在的行为表现。但实际做的时候,把两个模态的特征直接拼起来喂模型,效果反而比单模态的好模型差。为啥?论文说问题出在EEG上的伪迹——比如眼动、肌肉收缩这些无关信号,会把EEG的有效信息弄脏,导致融合时的共享表征全是噪声,说白了,这就是把两份脏数据混一起,想凑成“干净的多模态”,结果反而比其中一份还脏。
差分注意力的核心玩法
要把这俩模态用好,得先把EEG的噪声清了再谈融合。论文出了个叫EmoSpeechBrain的多模态框架,核心逻辑是:降噪是有效融合的前提。
它的EEG编码器用了差分注意力——简单说就是生成两个注意力图,然后相减,把两个图里都有的噪声部分抵消掉,剩下的就是对情绪判别有用的神经活动。比如EEG里本来有眼动带来的固定噪声,两个注意力图里都包含这个噪声,相减就消掉了。
另外还有个基于注意力的门控适配器,作用是把EEG和语音这俩不同维度的信号对齐到同一个特征空间,还能给每个模态的贡献打“权重分”——比如某句话的语音情绪很清晰,就多给语音的特征分配权重;如果EEG的信号更靠谱,就侧重EEG,这样融合出来的结果更精准。
实打实的提升有多少?
论文在两个公开数据集PME4和EAV上测了效果,数据不会骗人:
和之前最先进的(SOTA)EEG编码器比,EmoSpeechBrain把情绪识别准确率最高提升了12.9%;
比单模态语音基线,最高提升13.1%;
比单模态EEG基线,最高提升23.1%。
这些结果证明:之前的简单融合没解决EEG噪声的问题,所以是“假融合”;现在先给EEG做了差分注意力降噪,再和语音融合,才是真的互补,效果一下子就上来了。
这篇论文的意义,其实是给多模态情绪识别踩了个坑——不是模态越多效果越好,也不是随便凑在一起就行,得先搞定每个模态的“无效干扰”,再谈融合的互补性。那以后的多模态模型,会不会都先给每个模态做专属的“清洁处理”,再进行融合?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧