全球首例针对AI的双盲评估项目,最近悄悄启动了试点。这事没上热搜,但在AI圈里,不少人觉得这是件绕不开的事。
双盲在AI里,到底盲了啥?
你知道双盲试验的逻辑:排除主观偏见。放到AI评估里,之前的评测几乎都做不到这一点。比如去年某评测机构的“Top3大模型”,三家全是国内头部玩家,结果出来后,有人扒出其中两家的测试题是自己训练数据里的原文,还有一家的评测人是前大厂的员工——偏见的口子早就开了。
这次的双盲,核心是把“身份”从评估里抹掉。评估者不知道被测AI属于哪家公司,只看它的输出结果;被测AI也不知道自己正在接受测试,不用为了冲排名临时优化某些测试场景。简单说,就是让AI“裸奔”:只比真本事,不比“出身”。
为什么非得跟“身份”较劲?
之前我帮朋友对比过几款AI写作工具,某大厂的产品,写出来的东西跟新闻稿似的,套话多,但因为是大厂的,有人就说它“专业”;一款没听过的小厂产品,写出来的内容更贴合需求,却被评测人打了低分,理由是“逻辑不够严谨”——说白了,就是看牌子打分。
这种情况多了,AI评测的意义就变了:不是比能力,是比“谁的后台硬”。双盲的出现,就是想把这层窗户纸捅破。这次试点,就是想看看:去掉身份标签后,AI的真实能力,能不能被公平地测出来?
这步,对AI行业意味着什么?
如果这次试点能成,以后的AI评测可能会重新定义“公信力”。现在的第三方评测,要么是机构为了赚钱接了大厂的单,要么是大厂自己晒结果,都没法完全避免偏见。双盲评估的最大价值,是给行业提供了一个“干净”的参考标准——不管是大厂还是小厂,只要在双盲测试里表现好,就是真的好。
当然,双盲也不是没有漏洞。比如怎么设计测试题?会不会有人故意生成“看起来对但实际没用”的内容来骗分?这些都是这次试点要解决的问题。
那你觉得,以后我们选AI产品,还会先看品牌吗?
素材来源:Google DeepMind Blog · AI情报、AI政策与监管
查看报道原文

发表第一条评论吧