大模型做跨多源的复杂任务时,终于有了实打实提升成功率的方案:名为RECAST的框架,在6个异构基准家族上平均成功率75.6%,比当前最强大模型基线高出15.9%。
一、不是“搜资料”,是“拼证据”——RECAST的核心定位
之前我们接触的检索增强生成(RAG),不管是传统那种固定按相似度搜资料,还是会主动调整查询关键词的agent版,核心逻辑都是“搜现成的”:把问题和知识库的单份内容匹配,捞出来用。但很多任务的答案根本不在某一份资料里——比如要算两个数据集的交叉分析值,或者从三篇不同报告里各取一个关键点凑成结论,这时候单纯靠检索就没用了。RECAST干的事,是把证据构建从“被动检索”改成“主动组合”:它把解决问题需要的证据,当成是对多源信息做过滤、聚合、计算的顺序决策过程,不是只搜,还要自己选怎么拼这些信息。
二、三个模型的分工:轻量决策+冻结执行
这个框架的运作逻辑没玩太复杂的花活,拆成三个各司其职的部分,还能用现有成熟模型改:首先是轻量的RouterLM,负责做每一步的决策——要么选预定义的基础操作(比如“过滤掉无关摘要”“把两个数值相加”),要么直接指定自定义操作;然后是被冻结的CompilerLM,把RouterLM的指令转成可直接运行的代码;最后也是冻结的AnswerLM,等RouterLM判断证据足够后,直接用这些拼好的证据出最终答案。训练的时候,先拿监督微调(SFT)打基础,再用组相对策略优化(GRPO)优化RouterLM的决策质量。有意思的是,哪怕只用Qwen3.5-9B这种中小参数的RouterLM,训练出来的效果,比完全没训练的Gemini 3.5 Flash RouterLM还要好5.0%——这说明训练的收益确实在,而且中小模型也能练出有用的决策能力。
三、补了RAG的短板:泛化能力也够硬
除了6个基准家族的亮眼成绩,RECAST的泛化能力也超出预期:在三个没见过的基准上,平均比最强基线高15.0%,零任务、零源类型的适配性很强。这对现在依赖RAG的场景来说,是补了一块真痛点——之前RAG搞不定的“多源信息联动计算”,现在有了可落地的路径。比如企业里跨多个数据库的数据分析,或者需要整合多篇论文观点的调研,RECAST这种主动组合证据的思路,可能比单纯搜资料要靠谱得多。
不过有个现实问题没答案:要是面对完全没见过的任务类型,这个框架的操作空间能不能覆盖?毕竟现在它的操作是基于预定义的原语,万一遇到需要全新逻辑的场景,会不会就失效了?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧