它到底是什么?
Drex 1.5在公开决策基准Decision Index 0.3.1上拿到58.08分——这是100亿参数以下模型里的最高分,和闭源标杆Jev 1.13.0的57.96分差仅0.12,刚好落在官方划定的平局区间里。这是Nace.AI刚开源的新产品,核心定位和大家熟悉的生成式大模型完全不同:它不写文本,也不生成代码或解释,只做一件事——给你指定的选项打分。
输入是你提供的状态文本/JSON结构,加上你提的问题;输出是每个选项的概率或分数,不需要采样温度、top_p这类生成式大模型的参数。它支持三种问题类型:单选、是否判断、序数打分。更贴心的是,它用的API格式和TypeSafe的闭源模型Jev完全一样,现有Jev的客户端只要改几个环境变量就能切换,适配门槛极低。
核心参数与部署灵活性
Drex1.5的参数规模是8.95B稠密参数,bf16权重约18GB,默认上下文窗口16384 token,最高支持131072 token。运行门槛很低:bf16精度版可以在24GB显存的A10G单CUDA GPU上跑;量化后的Q8_0 GGUF版本仅9.5GB,能直接在苹果硅芯片或普通CPU上运行。
部署路径也很灵活:除了Nace官方的Python脚本,还可以用Nace修改过的llama.cpp、Ollama,甚至OpenRouter的托管版——后者每百万输入token收0.04美元,输出完全免费。Nace测试过AWS g5.2xlarge的A10G和苹果M5 Pro,发现bf16和Q8_0版本的输出结果完全一致,兼容性没毛病。
性能的长板和短板
它的核心优势是长文档处理能力:32k到128k token的长文档,准确率达到93.4%,中位数响应时间2秒;8k到32k token的准确率也有89.5%,仅0.65秒就能出结果。但如果把同一段内容截断到8k token,准确率直接掉到76%到78%,说明它的长上下文理解不是噱头,真能用上。
不过短板也很明显:知识类和推理类任务拉胯,GPQA钻石数据集的准确率只有45.4%,ACOS情感分析的F1值仅7.4%,而同场景下Jev分别达到78.6%和29.5%。它在工具类任务的得分是75.0%,但知识和推理类只有44.6%。另外,它的训练是基于决策基准的官方拆分,新领域的表现可能会打折扣。
对开发者来说,这个模型的最大价值是轻量、开源、部署成本低,适合做那些不需要生成文本的决策场景,比如请求路由、任务分配、选项筛选。要注意的是,它的License是RAIL-M,有明确的使用限制,商业落地前得仔细核对条款。当智能体的核心需求从“生成文本”转向“精准决策”时,这类专用的轻量模型,会不会比通用大模型更实用?
素材来源:MarkTechPost · AI情报、开源生态
查看报道原文

发表第一条评论吧