arXiv上一篇cs.LG方向的论文,戳中了做表格分类的核心矛盾:大模型有知识但推理成本高、没法解释;决策树快还透明,但数据少的时候准确率拉胯。
大模型和决策树的天生错配
现在很多团队做表格分类,要么选大模型——比如用GPT直接生成分类结果,它懂的多,泛化能力强,但问题也明显:算一次要花不少钱(推理成本高),而且结果为啥这么判,说不清楚(可解释性差)。另一种选法是用决策树,每条规则都明明白白,速度也快,可要是数据太少(也就是小样本场景,比如刚上线的业务只有几百条数据),它就容易跑偏,准确率还不如大模型。这俩明明各有优势,却一直没法凑出一个双赢的方案。
三步法:不用让大模型直接生成整棵树
这篇论文的解法,是把大模型的知识“蒸馏”成决策树,而且专门针对小样本场景。它的核心思路很简单:别让大模型直接生成完整的决策树——之前这么做要么结果不稳定,要么要花巨多的提示词费用(就是调用大模型的token成本),太不划算。论文设计了一个三阶段的流程:先让大模型生成分类规则,再把这些规则整理、拼接成一棵决策树。
论文说,在多个真实的表格数据集上测下来,这个方法比现有基准的准确率更高,可解释性也达标,最关键的是,提示词的开销比之前的方法低很多。相当于用更少的钱,拿到了比单一大模型或常规决策树更好的结果。
给表格分类的人提个醒
这个新框架,刚好填补了小样本场景的空白。之前做表格分类,要么凑够数据用大模型,要么只能将就用小样本下不准的决策树。现在不一样了,要是数据少,又要结果可解释、不能花太多钱,这个方法刚好能用。比如金融风控要说明“为什么这笔贷款拒了”,医疗分类要讲“根据哪几个指标判断病情”,这种要对结果负责的场景,就很适合用。
不过反过来想,论文里“蒸馏大模型知识到可解释模型”的思路,会不会还有更灵活的玩法?比如除了决策树,能不能蒸馏成其他结构?或者能不能用到更多小样本任务里?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、AI基础设施
查看报道原文

发表第一条评论吧