现在用推测解码提速大模型推理,但训练并行草稿模型的核心矛盾一直没解决——之前的训练目标都是“凑局部损失”,根本不管全局解码要跑多少轮。
之前的训练是“盲人摸象”
并行草稿模型(比如业内常用的DSpark、DFly这类)的核心逻辑是:一次传进一整段token给目标模型验证,不用一个个来,提速很明显。但训练时的麻烦是:某位置的草稿分布,取决于上一轮解码到哪,而每轮解码的起点,又取决于前一轮收了多少token。之前的训练目标,用的是“块级替代损失”,完全不管这种“轮次间的耦合”,优化出来的模型,只是局部损失低,但全局解码的轮次没真的降下来,等于白练。
新框架:把解码变成数学可算的过程
这篇arXiv上的论文,把推测解码建模成马尔可夫奖励过程,直接定义了一个叫“期望解码轮次(EDR)”的训练目标。这个目标不用额外加超参数,把局部拒斥的代价按状态占比加权,算出来的结果就是全局期望解码轮次。同时配套了精确的时序差梯度,支持从目标模型的rollout里做无偏随机优化;还有一个精确的离线评估器,不用真的跑推测解码,就能用共享的目标模型输出,对比不同草稿模型的轮次表现。
实测:DSpark和DFly的提升真的打穿了
论文微调了两种当前最先进的草稿模型DSpark和DFly,测试了9个基准,覆盖数学推理、代码生成、对话场景。结果很实:新训练出来的模型,平均接受长度提升了,比之前所有训练目标的效果都好。
这篇论文的贡献,是把推测解码的训练从“局部凑数”拉到“全局抓效率”,相当于摸到了提速的根儿上。但反过来想,大模型公司手上已经有成熟的草稿模型训练流程,这套新方法要改现有流程,会不会比重新训练大模型的边际成本更低?
素材来源:arXiv (LLM/多模态新论文) · AI情报、融资并购、科研前沿
查看报道原文

发表第一条评论吧