有点子了,就去执行……
《冻住的多模态大模型,能定位“左边黄香蕉”里的修饰词?》
你让多模态大模型(MLLM)描述图里的水果,它说“左边黄香蕉”,那你知道它是怎么确定“黄”和“左”对应图里哪块区域的吗?之前没人在意这个——大家只盯着“香蕉”的定位,把“黄”“左”这些修饰词当成...
LLM的小世界连接:对应推理性能的结构密码?
用六款LLM做剪枝实验,小世界结构完好的模型,推理性能掉得更少——arXiv cs.AI分类的这篇研究,把LLM的内部结构和推理能力直接挂上了钩。为什么不看“表现”,要看“内部结构”?之前评估L...
TestPrism:别用单一参考评代码测试质量
同样是评估大模型代码生成的测试质量,按行业常规的单参考方案算,14款基线模型的通过率有59.67%;但换成TestPrism这套新框架的核心指标,通过率直接掉到28%。这个反差,戳破了代码测试评...
ARGUS:修复AI解读基因组变异幻觉的框架
全基因组关联研究里,超过90%和疾病相关的变异都藏在基因组非编码区。可现有AI解读这些变异时,十有八九会瞎编数据——这是基因组医学领域没人敢说的痛点。AI解读非编码变异,为啥总“瞎编”?大语言模...
DVD解码方案:解决多模态大模型感知的效率痛点
在RefCOCO、KITTI、nuScenes等多模态感知基准测试里,一个叫DVD的新解码方案,让多模态大模型(MLLM)在2D和3D感知任务上,既提升了性能,又砍了token开销、降了推理延迟...
EgoVoice:从第一视角流里主动说话的AR助手
AR助手主动搭话这件事,目前做得特别差。哪怕是零样本的基础模型,也很难踩中你真正需要提示的点——要么早了帮不上忙,要么晚了根本没用。直到arXiv那篇归类在cs.CL、cs.CV、cs.SD的论...
TokenRouter:让token级LLM路由效率提升2到64倍?
TokenRouter在多种路由算法、工作负载和模型配对下,解码吞吐量是现有系统的2.01到64.15倍——这是arXiv上一篇cs.CL分类的论文给出的实测结果。现存token级LLM路由服务...
JetBrains推Mellum2.1:12B MoE开源模型瞄准编码智能体
JetBrains刚更的Mellum2.1,把SWE-bench Verified的分数从2.0拉到了47.0——这个提升幅度够让做代码大模型的人眼前一亮。升级的门道:几乎全靠真实代码环境的RL...
残差建模:缩小机器人回归与生成策略的差距
做机器人学习的人都知道,从演示数据训策略,扩散、流匹配这类生成策略,比用MSE的直接回归策略效果好。之前大家都把这差距归因为演示数据的多模态——同一个状态下,合理动作可能有好几个选择。但这篇ar...
Natura的99美元智能戒指:按手指召唤AI还测健康
99美元的智能戒指,现在能按一下手指召唤AI代理,还能测健康?Natura刚推的这款Interface smart ring,就把这两样凑成了。Natura的这款智能戒指,能干嘛?这款产品的核心...
