星光澄海 | BLOG
有点子了,就去执行……
大模型容错性随规模增强 低故障硬件或成节能突破口
4万GPU小时的训练跑下来,AI研究者撞破了一个反常识的结论:大模型的容错性,不是随规模变大而下降,反而会增强。反常识的训练结果这次训练用的是模拟故障的数字硬件,不是真实的故障芯片。研究者盯着大...
2026-10-07 0 0 人工智能/应用
SemanticFold:压缩居然拆分了大模型的三大核心能力
在Qwen3-1.7B模型上,用1.7倍压缩率应用SemanticFold后,压缩分支的负对数似然(NLL)比原生分支低了0.135——这是arXiv那篇序列压缩论文里最反常识的结果,一般压缩模...
2026-10-07 0 0 人工智能/应用
机器人抓稳的秘密:触觉数据提了10.5个百分点成功率
用多手指机器人抓东西,加了高分辨率触觉数据后,抓稳成功率比只用视觉的提了10.5个百分点——这是arXiv上一篇cs.RO分类的最新研究,没玩虚的,全是实测堆出来的结果。实验怎么来的?1万次抓取...
2026-10-06 0 0 人工智能/应用
基于WFR-JKO的神经采样新方法 避开对数凹性限制
arXiv刚上线一篇属于math.NA、cs.LG、math.PR、stat.ML四分类的论文,直接戳破了神经采样领域的一个旧限制——之前要从复杂多模态分布里采样,大多得默认目标分布是对数凹的,...
2026-10-06 0 0 人工智能/应用
超越LLM-GA:ReEvo让流体天线系统更安全
相同迭代次数下,ReEvo算法在流体天线系统的安全和速率上,比传统遗传算法和现有最先进的LLM辅助遗传算法表现更好。流体天线的安全瓶颈,原来的方案有短板流体天线系统空间灵活性极强,军用、卫星、物...
2026-10-06 0 0 人工智能/应用
LLM劝说力的评估:不同方法结果为何天差地别?
arXiv上一篇归类于cs.CL、cs.AI、cs.CY的论文,把9种已发表的LLM劝说力自动化评估方法,统一套在15款大模型上跑了一遍。最后算出来的排名一致性,平均只有0.25——这个数值叫斯...
2026-10-06 0 0 人工智能/应用
大模型生成决策树:小样本表格分类的新路径
arXiv上一篇cs.LG方向的论文,戳中了做表格分类的核心矛盾:大模型有知识但推理成本高、没法解释;决策树快还透明,但数据少的时候准确率拉胯。大模型和决策树的天生错配现在很多团队做表格分类,要...
2026-10-06 0 0 人工智能/应用
AI能写代码,软件工程师反而成了刚需?
arXiv上一篇被归类为计算机科学下软件工程(cs.SE)与人工智能(cs.AI)方向的论文,刚推翻了“AI淘汰软件工程师”的流行观点。你可能听过类似的讨论:AI写代码越来越快,软件工程师会不会...
2026-10-06 0 0 人工智能/应用
Healthleap获3800万美元融资,发力医院患者AI预警
Healthleap刚官宣了一笔3800万美元的融资:800万是红杉、First Round领投的种子轮,剩下3000万由Hummingbird领投A轮。这笔钱投给了啥?外界先关注的是它的核心产...
2026-10-06 0 0 人工智能/应用
分布式LLM公平性审计:对抗“漂绿”的新方案
哪怕49%的审计者是恶意的,新的审计方案也不会让不公的LLM蒙混过关。现在大语言模型要做合规审计,公平性是监管的核心要求。传统黑箱审计需要审计方拿到大量有代表性的查询数据,实际很难实现,于是业内...
2026-10-06 0 0 人工智能/应用