星光澄海 | BLOG

情感分析的共识缺口:人、工具、大模型各说各话

拿100条推文找6个人评情感,结果发现就算是人,对情绪的判断也只处于“一般一致”水平——这是arXiv上一篇cs.CL分类的研究刚捅破的窗户纸。研究专门测了人和工具对社交媒体文本的情感判断一致性,对象包括3款定制工具、3款大语言模型(LLM),还有6个人类评分者,用两个统计指标量化一致程度。

人和机器的“评分打架”现场

先看人类的表现:6个评分者对同一条推文的情感判断,一致度只到统计意义上的“一般”。那机器呢?不管是定制工具还是大模型,都没比人好多少。更有意思的是分类方式影响结果:把情感分成“负、中性、正”三类的时候,分歧特别大;但分成“负vs非负”“正vs非正”二元类别的时候,不管是人还是机器,一致度都明显高一截——毕竟二元选择的容错空间本来就比三元小。

谁和人类的判断最“同频”?

三款定制工具是TextBlob、VADER、Twitter-roBERTa-base;三款LLM是Qwen3-32B、GPT-OSS-120B、Llama-4-Maverick-17B。对比下来,Twitter-roBERTa-base是全场和人类对齐度最高的——比另外两款定制工具,也比三款LLM都好,尤其在区分“负vs非负”的时候,几乎是最接近人类判断的。LLM这边的表现有点分化:它们自己内部的判断一致度挺高,但和人类的对齐程度是中等偏上;而且在“正vs非正”分类上,LLM反而比定制工具更顺手。

这事儿给做情感分析的提了醒

研究的核心结论其实很实在:社交媒体的情感分析,还是得靠领域特定的微调——毕竟通用模型哪怕是百亿级参数的LLM,碰到带梗、反讽、网络黑话的推文,还是容易偏。另外,人类标注的“金标准标签”必不可少,机器再强,也得跟人的判断对齐,不然算出来的情绪结果根本站不住脚,没法用来做品牌舆情或市场分析。

说白了,别迷信什么“AI能搞定所有情感分析”——哪怕是号称能理解上下文的大模型,碰到社交媒体这种充满主观情绪的文本,还是得跟人碰。而且你看,现在的工具和模型,连基本的情感分类都还没完全和人类达成共识。那问题来了:要是以后正规的情感分析工具,必须绑定人类标注才能用,小团队还能玩得起这种活吗?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown