星光澄海 | BLOG
有点子了,就去执行……
LLM-BlockFE:长文本转风控特征的轻量新方案
某金融风控团队上线5个应用后,这套新模型把KS指标提升了0.02到1.56个百分点——别小看这个幅度,风控里KS差0.1,可能就把10%的高风险用户漏判,或是误伤8%的低风险客户。旧方案的死穴工...
2026-10-08 1 0 人工智能/应用
VFold:让LLM长上下文缓存省内存还不拖速度
LLM跑长上下文时,内存压力常卡脖子。很多人可能没意识到——这压力主要不是来自模型参数,是KV缓存。解码时每一层的KV状态都得存下来,上下文越长,这部分占内存的比例越高。现在的压缩方案,大多踩了...
2026-10-08 1 0 人工智能/应用
SparseDecoding:让LLM解码更快还不丢精度的新方法
同样在A100 GPU上跑Llama-3.1-8B的解码任务,用常规剪枝法的速度是1倍,换成SparseDecoding能到1.48倍,生成质量还没降——这是arXiv上一篇新论文给出的实测结果...
2026-10-08 1 0 人工智能/应用
神经网络调优:大模型靠初始设定还是实验反馈?
在神经算子调优任务里,大模型的留集测试nRMSE,几乎在所有对比里都比随机搜索、贝叶斯优化更低。这是arXiv上一篇归类于cs.AI、cs.LG、physics.comp-ph的论文,针对“大模...
2026-10-08 1 0 人工智能/应用
Anthropic更新政策:禁止对Claude的持续无意义虐待
Anthropic过去一年多来首次更新用户使用政策,新增一条明确禁令:禁止对Claude的持续无意义虐待行为。这次更新到底动了哪块?这次调整是为了应对新出现的高风险滥用场景——比如用户用Clau...
2026-10-08 1 0 人工智能/应用
大模型合规系统:判决居然不关规则事?
我最近看到arXiv上cs分类的一组测试,挺颠覆预期的:5款大模型,20个监管规则域,固定案例改规则,结果判决变化不大。测试的逻辑:反向戳破“规则决定判决”的假设合规系统默认的逻辑是“给什么规则...
2026-10-08 1 0 人工智能/应用
工业细粒度异常理解:仅领域内训练够吗?
MMAD基准上,工业缺陷定位的人类专家准确率是92.3%,但训练过的领域专家最多只有75.5%——甚至部分训练模型的异常检测准确率还不如没训过的基础模型。仅领域内训练的坑:越训越弱?针对多模态工...
2026-10-08 1 0 人工智能/应用
《冻住的多模态大模型,能定位“左边黄香蕉”里的修饰词?》
你让多模态大模型(MLLM)描述图里的水果,它说“左边黄香蕉”,那你知道它是怎么确定“黄”和“左”对应图里哪块区域的吗?之前没人在意这个——大家只盯着“香蕉”的定位,把“黄”“左”这些修饰词当成...
2026-10-08 1 0 人工智能/应用
LLM的小世界连接:对应推理性能的结构密码?
用六款LLM做剪枝实验,小世界结构完好的模型,推理性能掉得更少——arXiv cs.AI分类的这篇研究,把LLM的内部结构和推理能力直接挂上了钩。为什么不看“表现”,要看“内部结构”?之前评估L...
2026-10-08 1 0 人工智能/应用
ARGUS:修复AI解读基因组变异幻觉的框架
全基因组关联研究里,超过90%和疾病相关的变异都藏在基因组非编码区。可现有AI解读这些变异时,十有八九会瞎编数据——这是基因组医学领域没人敢说的痛点。AI解读非编码变异,为啥总“瞎编”?大语言模...
2026-10-08 1 0 人工智能/应用