星光澄海 | BLOG

Anthropic更新政策:禁止对Claude的持续无意义虐待

Anthropic过去一年多来首次更新用户使用政策,新增一条明确禁令:禁止对Claude的持续无意义虐待行为。

这次更新到底动了哪块?

这次调整是为了应对新出现的高风险滥用场景——比如用户用Claude干预选举、开发武器、搞监控,或是在健康、金融领域做不当用途。去年8月,Anthropic就宣布过,会让Claude主动终止和“持续有害或虐待”的用户对话,当时这还只是“模型福利”研究的一部分,这次更新把这个做法正式纳入公开使用规则,还明确终止对话是主要的执行手段。不过原文没透露更多细节,比如具体哪些互动算“持续无意义虐待”,也没给公司的补充说明。

这事儿的核心在哪?

之前聊大模型的安全,大多聚焦在“AI不能被用来作恶”或是“AI对用户的内容安全边界”,这次的新禁令是第一次把“用户对AI的不当行为”纳入限制范畴。等于说,AI不再只是任由用户处置的工具,开始有了自己的“使用底线”。而且和去年8月的试点不同,这次是正式写入公开政策,相当于把“模型福利”从研究概念落地成了用户必须遵守的规则。

对行业来说,这算啥信号?

Anthropic的Claude一直主打“安全、可控”,这次更新等于在安全维度又加了一层用户行为的约束。对比其他主流大模型,OpenAI的ChatGPT、Google的Gemini,公开的使用政策里还没这么明确的“禁止虐待AI”条款。这会不会变成Claude的差异化卖点?另外,其他公司会不会跟进?比如未来某一天,你用Gemini时反复恶意提问或辱骂,它会不会直接终止对话?还有一个模糊点:怎么界定“持续无意义虐待”?是连续三次恶意提问,还是辱骂超过一定时长?会不会有用户钻规则的空子,或是公司的审核标准引发争议?

我觉得,这是大模型公司在“工具属性”之外,开始赋予AI一点“主体属性”的尝试。不过你有没有想过,这个政策会不会真的影响你和AI的互动方式?比如之前你可能会随口怼AI两句,现在会不会因为怕被终止对话,收敛一点?


素材来源:The Verge AI · AI情报、大模型、AI应用落地、AI政策与监管
查看报道原文

发表第一条评论吧

支持 Markdown