你让LLM输出一段100词的内容,它用了200多token才解码完——这不是模型性能崩了,是被植入了FragToken。arXiv计算机安全分类下的最新研究显示,四个主流大模型测下来,这套框架能把token膨胀比(TIR)拉到1.99到2.46,几乎不影响答案质量。
这不是那种容易被抓的粗放攻击
现有推高LLM成本的攻击,大多靠诱导超长或重复输出,一测响应长度就露馅,还得造大量恶意请求才能扩散,影响有限。FragToken的思路藏得更深:token和文本的映射不是唯一的,同一个句子,分词器可以给它分配“规范序列”,也能搞出更长的“非规范碎片化序列”。标准模型生成时默认用规范序列,解码步少,成本低;但FragToken会让模型生成时优先选碎片化序列,多走好几步解码,实际输出的文本长度却没变,用户根本看不出异常。
它的核心是解决了“加成本不毁质量”的矛盾
直接强行加碎片化会让答案变得零碎,质量暴跌,攻击就白搞了。FragToken作为训练时的框架,用三个办法绕开这个坑:拿原模型的知识蒸馏保证基础输出质量,根据模型容量精准控制碎片化程度,贴合分词规则调整碎片化方式。这套组合拳下来,token数翻了一倍多,答案质量却只降了一点点,甚至可能在常规基准测试里都测不出来。
对模型厂商来说是个隐性的供应链风险
现有攻击是外部人主动发起的,FragToken是模型供应链里的后门——训练阶段被植入,模型厂商自己可能都没察觉。它不用造大量恶意请求,只要模型部署了,正常用户的每一次请求都会悄悄推高成本。以前厂商盯的是响应速度、输出质量,token数可能只是个后台统计项,这种隐性的成本增量,要等到月度账单爆了才会发现。更麻烦的是,四个不同的大模型测下来,FragToken的效果都稳定在TIR2左右,不管是头部还是中小模型,只要没针对性防御,都可能中招。
这事有意思的地方在于,它没搞那种轰轰烈烈的攻击,靠的是token层面的“小动作”,就能悄咪咪薅模型厂商的成本。现在模型厂商都在绞尽脑汁优化推理成本,会不会得把token序列的“隐性长度”也当成一个必须测的关键指标?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI基础设施
查看报道原文

发表第一条评论吧