星光澄海 | BLOG

从6647个案例到128K语境:H2S模型刷新长文本理解榜单

有个长文本理解模型的测试结果很扎眼——在128K输入、4K输出的预算限制下,H2S-14B平均得分32.60,比参数近一倍的Qwen3.8-27B高出10.17分,是目前所有评估开源模型里的第一名。

先高亮再总结,解决长文本的“找重点”难题

之前大模型处理几万token的长文档,总会被冗余内容带偏:有用证据散在无关信息里,模型抓不住核心。H2S的玩法是两步走:第一步先从源文本里精准挑出和问题挂钩的证据,第二步把这些证据整合成紧凑的、贴合问题的摘要,最后再输出答案。不是上来就堆上下文,而是先“删冗余”再推理,本质是把长文本的信息“压缩提纯”。

6647个案例堆出来的训练逻辑

光有想法不够,得有能落地的训练方案。他们造了H2S-Dataset,从11个基准任务里攒了6647个例子,平均每个案例的上下文是43.9K tokens——不算特别长,但足够让模型练会“找重点”。训练用的是H2S-RL,这个方法不只是看最后答案对不对,还给选证据、写摘要的过程打分:选的证据是不是真贴合问题?摘要有没有把有用信息留全?过程对了才给奖励,这样模型不会靠“蒙”拿分,真的学会了压缩证据的逻辑。

不拼参数的效果,才是真的进步

测试是在H2S-Bench上做的,共7个长文本任务,预算卡得很死:输入最多128K,输出最多4K。结果显示,H2S-14B不仅总分最高,证据摘要的质量也是所有模型里第一。还有个细节很关键:它在16K输出预算下的性能,放到4K预算里还能保留97.1%,说明压缩摘要的思路真的有用,不会因为输出短就掉链子。

现在行业里大家都在卷“窗口更大”,1M、2M的上下文吹得凶,仿佛越长的窗口越厉害。但H2S反其道而行之,用更小的参数、更紧凑的输出,拿到了更好的效果。那问题就来了:当大家不再比谁的窗口更长,下一轮长文本模型的核心竞争力,会是“精准抓重点的能力”吗?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、开源生态、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown