星光澄海 | BLOG

Goodfire推出“向内看”AI监控:抓失控AI成本仅需此前一部分

Goodfire刚公布了一款AI监控工具,主打抓失控AI agents,成本只要之前的一部分——核心逻辑不是让另一个AI当“监工”全程审,而是直接盯着AI模型内部的运作。

不用“第二AI复读机”,换个监控思路
之前做AI监控,主流玩法是找个额外的AI,把目标AI的所有输出、交互全“读”一遍——相当于雇个AI秘书,把目标AI说的每句话、做的每件事都转成文字,再给另一个AI老板查。这种方式的问题很明显:全程占算力,资源消耗大,成本自然高。很多中小团队或想玩AI agents的开发者,可能卡在这一步——想做安全但掏不起两个AI的钱。Goodfire这次的方案,直接把这个套路翻了:不搞外部全量审计,让监控嵌入目标AI内部,看模型本身的运行状态。

门道是“只在可疑时启动备份”
原文没说具体省了多少算力比例,但核心逻辑很清晰:之前的监控是“全时待命”,不管有没有问题,都让第二个AI跑;Goodfire的是“按需触发”——平时大部分时间,监控只在后台盯着模型内部的状态,不调用额外的AI算力,只有当内部状态不对劲时,才叫backup(原文提及的备份机制)介入。说白了,就是平时不瞎耗资源,出问题才集中发力,这就是成本降下来的关键。

对行业来说,这是个“降门槛的小突破”
之前AI监控的高成本,可能让很多想做AI agents的人望而却步——毕竟失控的风险摆在那,没监控不敢上线,但高成本又扛不住。Goodfire的这个方案,相当于把AI安全的入门费降了一档,至少不用再为“全量审计”买单。以后可能会有更多人,敢在自己的AI产品里加这层监控,不用怕出事。

不过话说回来,只看模型内部状态,会不会有盲区?比如有些失控是输出被偷偷篡改,或者是和外部交互时的异常,但模型内部状态仍正常——这时候这种“向内看”的监控,能查出来吗?


素材来源:TechCrunch AI · AI情报、AI智能体
查看报道原文

发表第一条评论吧

支持 Markdown