星光澄海 | BLOG

PHRBench:测LLM在幻觉后怎么修正错误

4820个受控测试实例里,大语言模型从幻觉中成功修正错误的情况,比多数人想的少。这是arXiv上cs.CL和cs.AI分类的一篇新研究,搞了个叫PHRBench的基准,专门盯着LLM“幻觉后推理”的表现。

PHRBench,专门测“幻觉后怎么改”

这个基准和之前的研究不一样——之前要么只看最终答案对不对,要么笼统统计推理的动态,从没仔细抠过模型在每一步是怎么处理那些错误前提的。PHRBench拉了四个领域的测试题,覆盖18个大模型,对每个模型的推理轨迹单独打分,不是看最后答案,而是三个核心指标:幻觉合规(会不会跟着幻觉走)、幻觉规避(能不能主动避开幻觉)、启发式修正(用啥思路改的)。还定义了“有价值的轨迹”——就是那种最终能修正错误、答对问题的过程。

两个核心发现

第一个是成功修正真的稀缺。4820个例子里,能做到修正并答对的,属于少见情况,而且和推理过程中频繁的信念更新挂钩——就是模型不是一条路走到黑,每一步都在调整自己的判断。第二个更实用:幻觉提示本身的特性,对能不能成功修正有很强的预测性。团队做了个轻量预测器,AUC拿到0.847,这个数字在分类任务里已经算不错的水平,相当于能靠提示的特征,预判模型会不会翻车。

对LLM玩家的启发

这事儿是个有意思的转向——之前大家头疼幻觉,全盯着“怎么让模型不编”,现在PHRBench把视线拉到了“模型编了之后怎么办”。尤其对多阶段的LLM系统来说,比如用户问了个带幻觉的问题,后续好几步推理会不会被带偏?这个基准正好能测模型在这方面的真实表现,开发者也能根据提示的特性,提前预判修正会不会失败,甚至优化模型的推理模块,让它遇到幻觉时敢调整,而不是死扛错误。

我觉得这个研究补了一块空白——之前没人这么细抠幻觉后的推理过程。但有个问题挺纠结:既然修正这么难,未来LLM的容错机制,是靠给模型加推理监控层,出问题就拉回来,还是干脆把所有精力砸在源头,从训练数据里就把幻觉的可能性压到最低?哪个路径,才是更高效的解法?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown