星光澄海 | BLOG

DIAL:校准大模型评分,解决顺序偏见与人机偏好差

今年在arXiv上挂出的一篇AI论文,带来了一个能让大模型当评委更靠谱的框架——DIAL,它的底气来自一组超过41万条的真实数据:是21个不同的大模型,在两种回答顺序下给出的评分。

大模型当评委的“命门”:两个藏在评分里的坑

大模型当评委,本质是用模型生成的排序代替人工评估——毕竟人工评数据量小、成本高,要覆盖海量LLM的性能对比,只能靠模型之间互相比。但之前一直有两个绕不开的问题:一是“顺序偏见”,把两个回答的展示顺序换一下,大模型给出的评分可能完全反过来,这叫“位置效应”;二是“人机偏差”,就算去掉了顺序影响,大模型的偏好也常常和人类的真实偏好不一样,比如大模型可能偏爱更工整、更符合训练语料风格的回答,但人类更喜欢更自然、更贴合需求的表达。这两个坑,让大模型当评委的结果一直没法真正对齐人的预期。

DIAL的巧劲:用海量模型数据校准少量人类判断

DIAL的思路不算玄乎,是用大量LLM之间的比较数据,结合少量人类的标注,解决前面的两个问题。它要做三件事:从大模型的评分里分离出“位置效应”和“模型本身的偏好”,比如确定某大模型本身偏好评A还是B,和展示顺序无关;把这些去了偏的模型偏好,整理成通用结构;再用有限的人类标注,把这个结构往人类真实偏好上校准。论文里还从理论上验证了这三点的可行性,实际测试结果更实在:在模拟和三个人类偏好基准测试里,DIAL对不平衡的回答顺序很稳,哪怕回答的顺序乱摆,也能给出一致评分;只用少量人类标注,就能得到符合人类预期的排名;当大模型的信息不准时,它会主动向人类判断靠拢,不会一条路走到黑。

对行业的实际价值:少花钱,评得准

现在AI行业测新出的大模型好不好,要么靠人工评(贵、慢),要么靠现有模型互评(不准)。DIAL相当于找到了一个平衡点:不用堆太多人类标注,就能让模型评估结果更对齐人。那组收集到的41万条、来自21个模型的双顺序评分数据,还能给后来的研究者当“标准数据集”,用来研究模型评分的偏误、不同模型的偏好差异这些问题。对做评估工具的团队来说,这可能意味着以后不用为了测准一个模型,花大价钱雇人评很久,用DIAL的框架就能高效出结果。

不过话说回来,DIAL目前的校准还是依赖人类的标注,要是人类的样本本身有偏差,会不会也把这个偏差带进结果里?它用的21个大模型都是公开主流模型,要是遇到小众的、自己训练的模型,这套框架还能管用吗?这些问题,可能得等更多实际测试才知道。


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown