Anthropic刚推送的Claude新模型,多模态基准跑分比GPT-6 Luna高12%,单任务成本比梁文谷低15%。昨天OpenAI给所有付费API用户发了重置使用额度的邮件——这是它近半年来第二次用这种方式挽留用户。
跑分对比没掺水
我翻了这次公开的测试数据,没有虚头巴脑的噱头。核心的三个维度:推理题的正确率,Claude比GPT-6 Luna高14%;代码生成的效率,比如修复bug的速度,高11%;还有10万字以上长文本的连贯性,高13%。总分直接领先12%,而且没有出现之前某些模型“推理强但代码拉胯”的偏科问题。对于做企业级服务的人来说,这种均衡的表现比单项突出更实用。
价格差的真实吸引力
定价才是这次最戳人的地方。Claude新模型每处理1百万token的费用,比梁文谷低了15%左右。别小看这个数字,对于每天调用API超过1千万token的中小企业来说,每月能省下至少三四千美元的成本。大模型服务现在还不是那种“必须用”的刚需,很多企业还在试水阶段,能省成本的好工具,谁不优先选?
OpenAI的应急操作,治标不治本
OpenAI的操作其实能看出来慌了。这次给用户重置的额度,是多给了20%的免费额度,没有任何使用限制。但这种临时的挽留,只针对那些已经绑定了OpenAI生态的用户——比如用了它的插件、或者和自家工具链打通的。对于只追求核心性能和价格的用户来说,Claude的优势更实在。之前OpenAI靠先发布的优势占了不少市场,但这次Anthropic直接在核心指标上压过一头,相当于把之前的先发优势给磨掉了。
有人说这是大模型的常态,迭代快,谁先出下一个更好的就能抢市场。但这次不同的是,Claude的优势是实打实的跑分和定价,不是花里胡哨的功能。之前OpenAI靠先发布的优势,在用户心里占了先手,但这次产品被压了一头,先手的优势也就没那么明显了。
现在的问题是,Anthropic这次的迭代,是能持续保持,还是只是临时的小突破?而OpenAI,除了送额度,能不能拿出真的能打产品?毕竟,用户最终要的,不是临时的额度,而是长期稳定的好服务。
素材来源:量子位 · AI情报、大模型
查看报道原文

发表第一条评论吧