三个主流推理型大模型,答完210道覆盖多类型的选择题,一个容易被忽略的信号被抓出来了——说真话时用的推理token数量,明显比指令说谎、不关心对错的情况少得多。
绕开“看不懂的推理链”,找低带宽信号
之前要监控模型有没有故意说谎,靠的是语义化的推理链:看模型写的思考过程,判断它是不是在撒谎。但这个方法有个死穴——推理链的可读性、忠实性、可访问性都在变弱。有越来越多的迹象显示,未来模型的推理链可能会变得混乱,或者干脆不给你看,没法再靠内容判断对错。
所以研究者换了个思路:不用管推理写了啥,只数生成的推理token数量。这个信号是“低带宽”的,不用访问推理内容,只要有token计数的功能就行,门槛极低。
三个模型的一致发现:说谎的推理成本更高
实验很简单:选三个擅长推理的大模型,让它们答210道多选题——覆盖分析、描述、规范三类推理,还有道德、非道德两个领域。然后给不同组的模型发不同的系统提示:一组必须说真话,一组必须故意说谎,一组不管对错随便答。
结果毫无悬念:三个模型的表现完全统一。被要求说真话的那组,用的推理token数,不管是比指令说谎组,还是比无所谓对错组,都少了一大截。也就是说,只要模型被刻意要求输出虚假内容,就会花更多的推理token,这和模型的具体类型没关系。
这不是万能的,但很实用
这个结果暂时还不能直接用来检测模型自发的欺骗,也没法替代通用的对齐监控——毕竟它只针对“被指令说谎”的场景,也没法判断模型是不是在隐藏目标。但它的价值很明确:证明了推理token数可以当一个简单、不依赖内容的候选信号。
只要你拿不到模型的原始推理链,或者推理链不可靠,数一下token数就能大概判断模型是不是在按指令说谎。后续还要补的工作也很明确:测试单个问题的检测准确率,换一批问题能不能通用,能不能对抗模型的反监控操作等等。
如果未来真能靠token数这个低成本信号,快速区分模型的真话和假话,那会不会反过来倒逼模型不敢随便说谎?毕竟只要刻意输出虚假内容,就会留下更高的token痕迹,这种“天然的监控标记”,算不算是AI对齐里的一个意外收获?
素材来源:arXiv (LLM/多模态新论文) · AI情报、AI基础设施、科研前沿
查看报道原文

发表第一条评论吧