星光澄海 | BLOG
有点子了,就去执行……
WOVEN:补上多模态大模型的视觉推理短板
38个顶尖多模态大模型里,没一个能达到人类的视觉推理水平。多模态大模型的集体硬伤多模态大模型(MLLMs)在空间、具象化、物理、时间推理上表现极差。研究人员发现这些失效其实指向同一个核心问题:视...
2026-10-08 1 0 人工智能/应用
GeoReform如何帮大模型搞定几何题?
Geometry3K数据集上,多模态大模型做几何题的准确率,之前只有42%。换了叫GeoReform的框架后,直接涨到56%。但你知道吗?之前有人试过另一种解法,在200个例子里,改了28个几何...
2026-10-08 1 0 人工智能/应用
大模型说的法律依据,算不算真的依据?
说出来你可能不信:7个从80亿到700亿参数的开源大模型,在法律推理里,说对法条或判例的概率能达到66.7%到100%;但你要是偷偷把它们引用的法条换成不相关的,它们的判决结果能跟着变的比例,最...
2026-10-08 1 0 人工智能/应用
突破长尾分布前置障:大模型SFT的自适应新方法
一篇arXiv上归类为cs.AI、cs.CL、cs.LG的论文,给出了一组可量化的实验结论:他们提出的PASS自适应SFT指令选择法,在4种不同主干模型+预算组合的测试场景里,连续超越7种当前最...
2026-10-08 1 0 人工智能/应用
VFold:让LLM长上下文缓存省内存还不拖速度
LLM跑长上下文时,内存压力常卡脖子。很多人可能没意识到——这压力主要不是来自模型参数,是KV缓存。解码时每一层的KV状态都得存下来,上下文越长,这部分占内存的比例越高。现在的压缩方案,大多踩了...
2026-10-08 1 0 人工智能/应用
神经网络调优:大模型靠初始设定还是实验反馈?
在神经算子调优任务里,大模型的留集测试nRMSE,几乎在所有对比里都比随机搜索、贝叶斯优化更低。这是arXiv上一篇归类于cs.AI、cs.LG、physics.comp-ph的论文,针对“大模...
2026-10-08 1 0 人工智能/应用
大模型合规系统:判决居然不关规则事?
我最近看到arXiv上cs分类的一组测试,挺颠覆预期的:5款大模型,20个监管规则域,固定案例改规则,结果判决变化不大。测试的逻辑:反向戳破“规则决定判决”的假设合规系统默认的逻辑是“给什么规则...
2026-10-08 1 0 人工智能/应用
工业细粒度异常理解:仅领域内训练够吗?
MMAD基准上,工业缺陷定位的人类专家准确率是92.3%,但训练过的领域专家最多只有75.5%——甚至部分训练模型的异常检测准确率还不如没训过的基础模型。仅领域内训练的坑:越训越弱?针对多模态工...
2026-10-08 1 0 人工智能/应用
LLM的小世界连接:对应推理性能的结构密码?
用六款LLM做剪枝实验,小世界结构完好的模型,推理性能掉得更少——arXiv cs.AI分类的这篇研究,把LLM的内部结构和推理能力直接挂上了钩。为什么不看“表现”,要看“内部结构”?之前评估L...
2026-10-08 1 0 人工智能/应用
TestPrism:别用单一参考评代码测试质量
同样是评估大模型代码生成的测试质量,按行业常规的单参考方案算,14款基线模型的通过率有59.67%;但换成TestPrism这套新框架的核心指标,通过率直接掉到28%。这个反差,戳破了代码测试评...
2026-10-08 1 0 人工智能/应用