有点子了,就去执行……
爱沙尼亚语文档简化:大模型表现差距明显
正文:爱沙尼亚语是种形态极其复杂的低资源语言,直到最近,它的文档级文本简化研究几乎是空白——这是一篇cs.CL分类的arXiv论文抛出来的事实。研究到底测了啥?文档级文本简化和改单个句子完全两码...
TaoD2C-Bench:测MLLM UI代码生成,不止看视觉
2861个来自17家商业平台的真实UI生产设计,97652条专家标注,这是刚在arXiv公开的TaoD2C-Bench基准数据集的全部家底——它专门测多模态大模型(MLLM)的UI代码生成能力,...
MultiFly:首个低空无人机多模态感知标注基准
115张手工标注的RGB图像,换来了17000多份多模态数据的帧级语义标注——这是刚公开的MultiFly数据集交出的核心成绩。多模态标注的老问题之前做低空无人机感知的,谁没为标注愁过?RGB、...
Open-MMUnlearning:统一多模态大模型遗忘的方法与评估
最近arXiv上挂出的Open-MMUnlearning框架,把多模态大模型(MLLM)遗忘领域的混乱,给梳理出了清晰的脉络——这个开源项目覆盖5个基准、8个模型家族、12种遗忘方法。为什么ML...
大模型生成开源电化学多物理模型,误差不到0.7%
同样的CO₂还原制CO的电化学反应模型,大模型写的开源代码,和COMSOL专业软件的结果差不到0.7%的峰值部分电流密度。测试场景与可复现性这次的测试选得很具体:一维电化学CO₂还原成CO的过程...
情感分析的共识缺口:人、工具、大模型各说各话
拿100条推文找6个人评情感,结果发现就算是人,对情绪的判断也只处于“一般一致”水平——这是arXiv上一篇cs.CL分类的研究刚捅破的窗户纸。研究专门测了人和工具对社交媒体文本的情感判断一致性...
SemanticFold:压缩居然拆分了大模型的三大核心能力
在Qwen3-1.7B模型上,用1.7倍压缩率应用SemanticFold后,压缩分支的负对数似然(NLL)比原生分支低了0.135——这是arXiv那篇序列压缩论文里最反常识的结果,一般压缩模...
机器人抓稳的秘密:触觉数据提了10.5个百分点成功率
用多手指机器人抓东西,加了高分辨率触觉数据后,抓稳成功率比只用视觉的提了10.5个百分点——这是arXiv上一篇cs.RO分类的最新研究,没玩虚的,全是实测堆出来的结果。实验怎么来的?1万次抓取...
基于WFR-JKO的神经采样新方法 避开对数凹性限制
arXiv刚上线一篇属于math.NA、cs.LG、math.PR、stat.ML四分类的论文,直接戳破了神经采样领域的一个旧限制——之前要从复杂多模态分布里采样,大多得默认目标分布是对数凹的,...
超越LLM-GA:ReEvo让流体天线系统更安全
相同迭代次数下,ReEvo算法在流体天线系统的安全和速率上,比传统遗传算法和现有最先进的LLM辅助遗传算法表现更好。流体天线的安全瓶颈,原来的方案有短板流体天线系统空间灵活性极强,军用、卫星、物...
