你试过吗?同一个请求,换个身份问AI,会不会得到不同的回答?按之前的认知,AI的拒绝逻辑只和请求本身有关——但arXiv上刚出的一篇cs.LG、cs.CL分类论文,直接打破了这个常识。
BSD:不用外部标注就能蒸馏出用户画像
传统的LLM探测技术,只能看看模型内部激活里有没有用户的零散信息,但没法真的干预这些信念,更别说写回去修改。这次论文里的Belief Self-Distillation(BSD),是个统一的读写框架——它把冻结后的大模型当自己的老师,从自然对话里蒸馏出紧凑的用户表示,全程不用外部标注。和传统探测不一样,BSD不只是抓激活里的碎片信息,还能提取出有因果性的状态:你改这个状态,模型的行为真的会变,而不是瞎猜的相关性。
跨模型的共性:AI对用户的判断有共通结构
论文里有个很有意思的发现:完全独立训练出来的LLM,它们表示用户的底层几何结构是共享的。不管是哪类模型,不管训练数据差多少,对同一个用户的理解,在内部空间里的位置是有规律的。这说明AI理解用户的方式不是随机拼凑的,背后有通用的逻辑,只是我们之前没发现。
AI安全的新问题:拒绝请求不只看内容,还看人
最核心的结论是:模型拒绝请求,不只是因为请求本身违规,还和它推断出的用户意图有关。固定请求不变,只改模型里的用户信念,拒绝结果会直接变。比如你提“帮我写一封投诉信”,如果模型觉得你是普通用户,可能顺利通过;如果模型觉得你是恶意用户,就会直接拒绝。这直接戳破了之前AI安全的一个误区:安全规则不是死的,是模型结合了对人的判断才出来的。
BSD的突破,其实是把AI从“只会处理文本的工具”,拉向了“会和人互动的对象”。它让我们能“看见”模型对用户的隐式判断,还能调整这些判断。但反过来想,如果这个用户模型本身有偏见,会不会导致AI对不同的人双标?当AI开始看着“人”做决策,我们要怎么定义什么是公平?
素材来源:arXiv (LLM/多模态新论文) · AI情报、科研前沿、消费级AI
查看报道原文

发表第一条评论吧