有点子了,就去执行……
DIAL:校准大模型评分,解决顺序偏见与人机偏好差
今年在arXiv上挂出的一篇AI论文,带来了一个能让大模型当评委更靠谱的框架——DIAL,它的底气来自一组超过41万条的真实数据:是21个不同的大模型,在两种回答顺序下给出的评分。大模型当评委的...
苹果Home AI摄像头,能赢过亚马逊谷歌?实测见分晓
去年带娃去海边找复活节彩蛋,手机被家里摄像头的“运动侦测”通知炸了——我以为是狗在院子晃,点进去加载半天缓冲不出来,那感觉别提多糟了。后来换了三个摄像头测AI功能,这事才算搞明白。三个摄像头,三...
RupeeBias:印度LLM经济指导的人口统计偏差审计基准
9款主流大模型给印度人做经济指导,仅因身份标签不同,输出结果平均差20.2%。这项研究发在arXiv的cs.CL分类下,推出了专门测印度场景LLM偏差的基准RupeeBias。为什么西方的AI偏...
训练中去重:联邦学习隐私保护的新范式
最新实验显示,一种新的训练中去重方案,让联邦学习故障恢复时间缩短93.04%,动态客户端加入耗时砍半以上。这是arXiv上cs.CR、cs.DC分类下的联邦学习隐私保护技术突破。旧范式的死穴之前...
区块链锚定AI安全:软件供应链的新防护框架
arXiv上一篇分类为cs.CR(密码学与安全)、cs.AI(人工智能)的论文,抛出了一个针对软件供应链安全的新方案——给代理AI框架套上区块链的安全壳。覆盖全生命周期的安全代理集群这个框架要管...
当LLM模型被退役:开源应用的迁移真相
你敢信?82%的LLM应用迁移,是在旧模型已经关停后才动手的——不管项目大小,有没有过迁移经验,哪怕用了模型抽象层也没用。这项研究扒了GitHub上2024到2026年的代码提交,从17703个...
UniAR:提升自闭症识别准确率1.2-1.5个百分点的新方案
在脑MRI数据集上,自闭症识别平均准确率做到75.9%;面部表情数据集上,这个数字是91.6%——这是刚出来的UniAR框架给出的结果,比现有最优方法还多涨了1.2到1.5个百分点。旧方法的死穴...
阿维塔高层调整:王辉转向长安海外,IPO仍在推进
据雷峰网独家消息,阿维塔内部系统里,王辉的董事长职位没变动,但他的精力已经完全转向长安汽车集团的海外业务——东南亚、中南美板块,他已经开始接手相关工作。调整的核心:从IPO操盘到海外扩张一年前王...
李斌内部讲话透底:蔚来明年有重磅新车,未来三年盯三个聚焦
今年1-8月国内乘用车销量跌20.5%,蔚来却同比涨了57.9%——李斌9月8日的内部讲话,把这说成是“决赛最残酷阶段”里的逆势跑。行业杀疯了,蔚来为啥还能跑赢?乘联会的数摆这儿:8月纯电渗透率...
智界RX对标华为Pura X,赵长江在想什么?
7月,智界V9单月交付10101辆,成交均价约50万元,高配占比超80%——这是一台起售价38.98万的MPV交出的答卷。放在鸿蒙智行的产品矩阵里,V9的成功有点意外,毕竟同级对手要么靠走量要么...
