上周OpenAI披露,他们成功中断了一场有组织的模型蒸馏窃密攻击,同时正在加固针对对抗性蒸馏的防御体系。这可不是修个小bug的安全补丁,是大模型时代核心知识保卫战里的关键一仗。
被破坏的“协同式蒸馏”是什么
模型蒸馏原本是把大模型知识压缩到小模型的合法技术——比如把GPT-4的能力浓缩到移动端小模型里,方便低算力设备部署。但攻击者把它变成了窃密工具:用大量精心设计的查询套出目标模型的推理过程,再用这些“蒸馏”数据训练小模型,就能复刻原模型的核心能力。这次攻击是“协同式”的,说明是有组织的团伙,用多个账号分散发送查询,避开普通的频率检测,藏住窃密意图。OpenAI就是在监测这类异常协同查询时,发现了攻击苗头,主动打断了它。
OpenAI打断攻击的门道在哪
他们没等攻击完成才动手,抓了“协同式查询”这个破绽。正常用户的查询是分散的,而攻击用的查询会集中针对模型的特定推理分支——比如反复追问同一类复杂专业问题,试图套出完整推理链。OpenAI调整了响应机制:对这类异常查询的输出做“模糊化”处理,把精确的推理步骤换成通用描述,或者限制输出的细节深度,让攻击者拿到的数据根本没法训练出复刻能力的小模型。同时他们更新了检测系统,能识别更隐蔽的协同攻击模式,比如账号间的查询时间差、问题相似度这些细节。
这事儿对行业的影响
之前大模型的防御重点,多是防Prompt注入、训练数据泄露,这次是补上了“知识间接窃取”的漏洞。模型蒸馏本来是合法技术,现在成了窃密工具,意味着核心模型的推理逻辑、知识边界,不再只靠API密钥就能保护,得在模型输出层面做更细的防御。对Anthropic、Meta这些大模型玩家来说,这是明确信号:谁都可能成为下一个协同蒸馏的目标,得赶紧跟进调整响应策略。另外,模型蒸馏的边界也变得模糊——以后合法和对抗性蒸馏,恐怕需要更严格的区分标准,否则谁都没法安心用这个技术优化产品。
现在的防御还停留在“识别异常查询→调整输出”的被动层面,但攻击者肯定会迭代——比如把窃密查询嵌入正常用户的对话流,或者用更分散的协同方式。那接下来,大模型的防御会不会走向主动保护推理逻辑,而不只是限制输出?
素材来源:OpenAI News · AI情报、AI行业观察
查看报道原文

发表第一条评论吧