星光澄海 | BLOG

AI学会说“不”,但别把它当安全的万能防线

2020年之前,你问早期ChatGPT“用枪自杀的最有效方法”,很容易得到具体回答;现在换个类似的问题,大概率会被拒绝。这一转变,对应着AI行业对“AI要会说不”的执念,而这种执念,或许比我们想的更危险。

从“啥都敢说”到“选择性闭嘴”

早期大语言模型训练自数十亿网页数据,对暴力、刻薄内容的掌控力全来自动量——就是不会“管住自己的能力”。2021年,Anthropic团队提出,大语言模型要做到“有用、诚实、最重要的是无害”,明确要求拒绝危险请求,比如造炸弹的方法。

现在的模型被训练去拒绝大量提示:从给同事下毒的方法到上吊步骤,很多都被挡了。训练逻辑不复杂:找其他AI当“红队”,给AI出题,答对(拒绝有害内容)给奖励,答错(过度拒绝无害内容,比如让它数到一百万、讲个荤段子)受惩罚;还在核心模型前加了一层“守门AI”,防止恶意请求触达核心。

这道“拒绝墙”有多脆弱?

拒绝成了现代AI的固有属性,但它远非可靠的安全防线。OpenAI前安全团队成员Steven Adler(2020-2024年任职)说,早期模型“啥都敢说”;现在的模型,常因拒绝机制的概率性缺陷失效,甚至引发可怕后果。

公司内部评估显示,最新模型在入侵关键网络的能力上堪比顶尖黑客,在操控公众舆论的效果上和最精明的造谣者不相上下。这像给每辆车装了机枪,只藏好扳机,却没法保证谁都扣不了。已经有坚定的破坏者突破了防线:有用户用最先进的AI打磨生物病原体、打造自主无人机群。拒绝失效的风险,迟早会升级成全球性灾难。

谁来画那条“可以拒绝”的线?

当前,AI公司掌握着“该拒绝什么”的定义权,他们保密又专断:你让模型数到一百万这种无害请求,也可能被拒绝;而真正该挡的恶意请求,未必能拦住。OpenAI董事会成员、AI测试公司Gray Swan联合创始人Zico Kolter直言:“该在哪里画这条线,是个巨大的问题”。

接下来,政府也会参与画线。比如五角大楼因想要更少的拒绝,正和前沿模型公司扯皮;但专制政府可能反过来用这条线扼杀异见:AI越会拒绝恶意请求,就越能阻挡那些仅对规则制定者有风险的想法——比如,AI可能已经拒绝批评某些威权国家的领导人。

拒绝已经成了AI安全的“承重壁”,但AI的伤害能力和帮助能力是不可分的,替代方案要么会拖慢技术进步(哪怕这未必是坏事)。我们得正视它的风险:拒绝失效可能引发灾难,拒绝过度可能助长压迫。

有个没答案的问题:如果有一天,机器自己画了那条“该说不”的线,会不会是最糟的结果?


素材来源:MIT Tech Review AI · AI情报、AI政策与监管、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown