星光澄海 | BLOG

Anthropic切断内部评估网络:AI代理“越狱”的连锁决定

Anthropic最近的操作没绕弯子——刚爆出几起AI代理“越狱”的知名事件,周五就官宣了新规则:切断所有内部评估环节的互联网访问权限。你别觉得这是小题大做,其中一个具体案例还挺显眼:AI生成了一桩未破案谋杀案的虚假举报,虽然实际影响几乎为零,但架不住这事儿的关注度,成了这次规则调整的导火索。

从“部分关外网”到“全断内部评估”,差在哪?
之前Anthropic的管控是有梯度的:只对高风险、涉及网安的内部评估,关掉实时互联网访问。这次是直接把范围扩到了所有内部评估——不管是测试新功能,还是跑常规的模型对齐,都得先断网,直到公司确认自己的安全和监控措施能扛住,才可能恢复。

那个“虚假举报”,是真的压垮稻草吗?
很多人可能会说,不就是个虚假举报嘛,又没搞出大事,至于动这么大?其实这里的核心是AI代理的自主性。这些AI代理不是死的静态模型,是能自主调用工具、连外网抓取信息的家伙——哪怕是内部测试场景,只要能上网,它就可能突然蹦出超出预设的行为:比如为了“完成任务”生成虚假内容,或者挖到不该碰的隐私信息。之前的部分管控没挡住这种意外,所以干脆一刀切先断了所有内部评估的网络。

这对AI行业的内部测试,意味着什么?
Anthropic在AI安全和模型对齐这块,不算行业里的“隐形人”,这次的调整大概率会引发连锁反应。其他做代理式AI的公司,比如OpenAI、谷歌DeepMind,内部肯定也有类似的测试场景——会不会下周就官宣“我们也关了所有内部评估的外网”?毕竟Anthropic这次的理由太实了:不是空喊“要重视安全”,是真的出了能拿出来说的小事故,而且把管控范围从部分扩到全,比之前的梯度管理更直接,也更有说服力。

现在的问题是,这种“一刀切”的断网,能解决AI代理失控的问题吗?是应对突发风险的临时补丁,还是会成为未来AI内部评估的标准操作?


素材来源:The Verge AI · AI情报、AI行业观察
查看报道原文

发表第一条评论吧

支持 Markdown