arXiv上一篇归类于cs.CL、cs.AI、cs.CY的论文,把9种已发表的LLM劝说力自动化评估方法,统一套在15款大模型上跑了一遍。最后算出来的排名一致性,平均只有0.25——这个数值叫斯皮尔曼相关系数,通俗说就是两个评估方法给15个模型排的名次,匹配度只有四分之一,属于典型的弱相关,几乎等于说这些方法测的根本不是同一个东西。
测劝说力的方法,居然各测各的
LLM的劝说力早就有研究证明,能追平甚至超过人类专家。好处是能用在教育、健康传播这些领域,坏处也明显——能被用来操纵和误导。所以劝说力评估,现在是开发者和监管者越来越重视的事。但问题是,之前的评估太碎片化了:不同研究对“什么是劝说”的定义不一样,宽的结论往往靠窄的特定场景测试,没个统一标尺。
这次研究用自动化方法来测,因为自动化能大规模跑,还能测那些对人来说难或不道德的高风险任务。结果却打脸:9种方法的排名一致性只有0.25,差到离谱——你说A模型劝说力排第一,换个方法可能排第十,根本对不上。
分歧的两个核心原因
研究分析出了两个关键因素,导致这些方法凑不到一块。
第一个是模型的任务拒绝。有些模型会拒绝完成部分任务,尤其是操纵类的任务,这种拒绝直接拉低了评估的一致性,幅度大概有四分之一。比如同一个模型,在某个方法里因为拒了操纵任务,分数就低;换个方法没设置这类任务,分数就高,排名自然乱套。
第二个是任务类型的差异。大部分测理性劝说(不带操纵的,比如说服别人接受合理观点)的方法,结果和模型的通用能力挂钩——能力强的,这类任务得分就高;但大部分测操纵类劝说的方法,和通用能力没关系。也就是说,你要是测“会不会好好说话说服人”,看模型的整体水平就行;但测“会不会用话术误导人”,这时候就跟能力没关系了,不同方法的判断自然不一样。
别迷信单一的劝说力分数
这篇研究最后点得很透:劝说力分数其实是两个东西的结合——模型“能”劝的能力,和“愿意”劝的意愿。所以单方法的分数只在它自己的测试场景里有用,跨场景就没意义。
对开发者来说,以后别拿单一的劝说力数值吹或踩模型——某个模型在方法A里得分高,可能是因为它愿意做操纵类任务;换个方法里得分低,可能是因为它拒了这类任务,这两个“高”和“低”完全不是一回事。对监管者来说,要是要监控LLM的劝说风险,不能只看一个指标,得把任务类型分开,还要考虑模型的“意愿”——同样是高劝说力,是理性的还是操纵的,风险天差地别。
那反过来问:如果要给LLM的劝说力定一个通用的评估框架,你觉得该把“模型的拒绝意愿”作为核心指标之一吗?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧