上周某AI模型评测的10项文本分类任务里,Jev这类决策模型的平均准确率,比LLM-as-a-judge低12%,比传统分类器低8个百分点。
Jev的“决策”,确实没拼过
Jev是主打可解释性的决策模型,每一步判断都能说出清晰的逻辑,理论上比黑盒的大模型更靠谱。但这次评测里,它在电商评论分类、客服问题归类这些实用场景里,连用了十几年的老分类器都打不过。比如识别用户“投诉”意图时,Jev把15%的“退款申请”归成了投诉,而LLM-as-a-judge只错了3%,传统SVM分类器的错误率是5%。换做实际业务,这种误差意味着每100个用户请求,就会多处理10个不该归为投诉的申请,效率差得不是一点半点。
卡在哪了?
评测团队单独测了100个边缘案例,找到Jev的核心问题:规则库跟不上口语化场景。它的决策链是固定的“如果X则Y”,遇到“这东西用两次就崩,能不能给个说法”这类带潜台词的表达,规则库没覆盖“崩”对应的用户核心诉求,就容易乱分类。而LLM-as-a-judge能抓取上下文的潜台词,一眼get用户是在投诉质量;传统分类器经过千万级数据训练,见过上万次类似的口语表达,判断稳得离谱,不会因为一句话的表述变了就出错。
对做模型的人来说,这事儿挺现实
之前不少人觉得,可解释是决策模型的王牌,比准确率重要得多。但这次的数字摆得明明白白:实用场景里,差10个百分点的准确率,比“我能说清每一步为啥这么判”更有吸引力。做Jev这类模型的团队,可能得放弃纯规则驱动的思路,多补点口语化、边缘场景的案例,不然再强调可解释,也没多少业务愿意买单。而那些做LLM-as-a-judge方案的,现在可以把这个评测结果当卖点——不用自己训模型,用现成大模型当裁判,分类准确率比传统方法还高,成本还低。甚至那些被说“过时”的传统分类器,也不用急着全换大模型:在小数据、规则明确的任务里,它们的泛化性和成本优势,还是比很多新模型靠谱。
现在大家都在聊模型的“可解释性”,可如果准确率能差出两位数,还有多少人愿意为“能说清理由”买单?
素材来源:Hacker News (AI/LLM) · AI情报、大模型
查看报道原文

发表第一条评论吧