Llama3.1做SST2任务时,用新防御方法SLDR把平均有害输出分从11.54压到了0.08,合法任务的准确率一点没掉——这是它刚在arXiv放出的实测结果。
恶意微调的隐形漏洞
现在很多人用微调即服务,把对齐过的大模型改成自己的专用工具。但有人会做恶意微调:表面上保留合法任务的性能,暗地里悄悄磨掉模型拒绝有害请求的本事——比如让LLM能输出诈骗话术、违规教程,却不影响它处理日常查询的正确率。这问题以前有人提过,但没找到太针对性的解法,因为普通微调后,安全能力和任务性能往往绑定,改一个容易动另一个。
SLDR的巧劲:只盯敏感层,动态触发
研究团队翻了近年的层安全诊断方法,发现个关键观察:模型不同层对安全的敏感度是带符号的——调某层的参数,可能增强拒绝能力,可能削弱,也可能完全没影响。他们就顺着这个思路做了SLDR:
一是只给敏感度最高和最低的层,训练一个LoRA恢复适配器(LoRA是小参数微调的常用方法,成本低);
二是推理时用“基于表征的动态路由”,平时只有处理恶意查询时,才激活这个适配器。
说白了,正常用模型时,它和原来没区别;遇到可能有害的请求,才触发专门的恢复机制,把磨掉的拒绝能力补回来,又不耽误合法任务的表现。
实测:有害分直降,中毒也扛得住
团队测了四个主流大模型架构,五个下游任务,四个有害基准,数据都挺扎实:除了Llama3.1/SST2的11.54→0.08,还有个更关键的细节:当恶意数据占比(中毒比例)高达0.9时,SLDR的有害输出分还是接近零,下游准确率没怎么跌。也就是说,就算微调时掺了90%的恶意数据,这个防御也能把有害输出压下去,合法任务照样能用。项目代码已经放去github了,链接是https://github.com/Stardust457/SLDR,想试的可以去扒。
这个方法的巧,在于没动模型的主结构,只针对敏感层做小修,还靠动态触发不耽误正常使用。现在行业里对付恶意微调,大多是微调前加过滤,或者微调后统一校准,SLDR算是另一个思路——事后补,但补得准,不牵一发动全身。
只是有个疑问:如果以后恶意微调的攻击者也盯着这些敏感层下手,这套防御会不会很快失效?
素材来源:arXiv (LLM/多模态新论文) · AI情报、AI应用落地、开源生态、科研前沿
查看报道原文

发表第一条评论吧