星光澄海 | BLOG

分布式LLM公平性审计:对抗“漂绿”的新方案

哪怕49%的审计者是恶意的,新的审计方案也不会让不公的LLM蒙混过关。

现在大语言模型要做合规审计,公平性是监管的核心要求。传统黑箱审计需要审计方拿到大量有代表性的查询数据,实际很难实现,于是业内想到让多个审计者协作,各用自己的查询覆盖不同人口群体,一起完成审计。但这个模式有个致命问题:审计者可能被LLM供应商收买,故意造假数据,把不公的LLM包装成公平的——这就是业内说的“公平漂绿”。

分布式审计的死穴:有人造假就全白搭。
之前的协作审计没有防造假的机制,哪怕只有一个恶意审计者,只要它伪造统计向量,就能左右整体的公平性评估,把明明不公的LLM估成符合标准的。研究人员先验证了这个风险:理论推导加实验都证明,单个恶意审计者就能篡改结果,让不公的模型“洗白”。

Auditopus的核心玩法:去中心化+动态降权。
针对这个漏洞,研究团队提出了Auditopus方案。它不用中心化服务器统一协调,每轮审计里,每个审计者先向LLM发固定数量的查询,然后只和其他审计者交换累计统计向量——既不用传敏感的原始查询,也避免了中心化节点被攻击的风险。关键的防造假设计在本地:每个诚实的审计者都会自动给统计向量和历史数据不一致的审计者降权,不用等第三方裁决,靠本地判断就能过滤恶意节点。

实测数据:抗恶意节点的能力超预期。
研究人员把Auditopus和两种主流的稳健聚合基线做了对比,用了两个数据集、两个预训练大模型。对抗那种专门优化造假向量来“洗白”LLM的攻击者,Auditopus比无防御的方案平均降低了78%的审计错误,比基线方案至少降低62%。更关键的是,哪怕49%的审计者都是恶意的,它也从来不会让明显不公的模型、甚至中等不公的模型通过审计。

不过,要是恶意节点比例超过一半,Auditopus的防线还能撑住吗?


素材来源:arXiv (LLM/多模态新论文) · AI情报、融资并购、大模型、AI政策与监管
查看报道原文

发表第一条评论吧

支持 Markdown