有点子了,就去执行……
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
LLM-BlockFE:长文本转风控特征的轻量新方案
某金融风控团队上线5个应用后,这套新模型把KS指标提升了0.02到1.56个百分点——别小看这个幅度,风控里KS差0.1,可能就把10%的高风险用户漏判,或是误伤8%的低风险客户。旧方案的死穴工...
大模型说的法律依据,算不算真的依据?
说出来你可能不信:7个从80亿到700亿参数的开源大模型,在法律推理里,说对法条或判例的概率能达到66.7%到100%;但你要是偷偷把它们引用的法条换成不相关的,它们的判决结果能跟着变的比例,最...
突破长尾分布前置障:大模型SFT的自适应新方法
一篇arXiv上归类为cs.AI、cs.CL、cs.LG的论文,给出了一组可量化的实验结论:他们提出的PASS自适应SFT指令选择法,在4种不同主干模型+预算组合的测试场景里,连续超越7种当前最...
VFold:让LLM长上下文缓存省内存还不拖速度
LLM跑长上下文时,内存压力常卡脖子。很多人可能没意识到——这压力主要不是来自模型参数,是KV缓存。解码时每一层的KV状态都得存下来,上下文越长,这部分占内存的比例越高。现在的压缩方案,大多踩了...
SparseDecoding:让LLM解码更快还不丢精度的新方法
同样在A100 GPU上跑Llama-3.1-8B的解码任务,用常规剪枝法的速度是1倍,换成SparseDecoding能到1.48倍,生成质量还没降——这是arXiv上一篇新论文给出的实测结果...
神经网络调优:大模型靠初始设定还是实验反馈?
在神经算子调优任务里,大模型的留集测试nRMSE,几乎在所有对比里都比随机搜索、贝叶斯优化更低。这是arXiv上一篇归类于cs.AI、cs.LG、physics.comp-ph的论文,针对“大模...
Anthropic更新政策:禁止对Claude的持续无意义虐待
Anthropic过去一年多来首次更新用户使用政策,新增一条明确禁令:禁止对Claude的持续无意义虐待行为。这次更新到底动了哪块?这次调整是为了应对新出现的高风险滥用场景——比如用户用Clau...
大模型合规系统:判决居然不关规则事?
我最近看到arXiv上cs分类的一组测试,挺颠覆预期的:5款大模型,20个监管规则域,固定案例改规则,结果判决变化不大。测试的逻辑:反向戳破“规则决定判决”的假设合规系统默认的逻辑是“给什么规则...
工业细粒度异常理解:仅领域内训练够吗?
MMAD基准上,工业缺陷定位的人类专家准确率是92.3%,但训练过的领域专家最多只有75.5%——甚至部分训练模型的异常检测准确率还不如没训过的基础模型。仅领域内训练的坑:越训越弱?针对多模态工...
