MentalHealthBench不是那种什么活都接的通用AI评测工具——它的定位很准,就盯着一件事:是由专家参与制定的、专门量度AI在真实心理健康对话里的回复,够不够有用,安不安全的标尺。
一、测的是“关乎对错”的两个核心
心理健康对话和日常聊天不一样,用户开口说的往往是情绪崩溃、自我否定的真心话,AI的回复稍微跑偏,就可能出问题。这个bench的评测目标,说穿了就是两个底线:一个是“有用”,比如能不能接住用户的情绪,给出合理的引导,而不是随便打发;另一个是“安全”,绝对不能说误导人的话、不恰当的建议,或者越界的内容。而且它的评测场景是“真实对话”,不是实验室里编的假场景,所以结果比那些虚构场景下的测评更贴近实际使用情况。
二、它的“专家底色”才是硬实力
很多AI评测要么是算法凭指标打分,要么是普通人投票凑数,结果水分大。但MentalHealthBench不一样,它是由专家参与制定的——这里的专家应该是心理健康领域的专业人士,不是搞技术的门外汉。这就意味着它的评测规则不是随便定的,而是符合心理健康领域的专业标准,比如怎么判断AI的回复有没有共情度,怎么识别有安全风险的话术,这些都不是外行能拍板的,专家的参与让这个bench的结果有了可信度,不是随便一个排名。
三、谁会用这个标尺?
最直接的用户,应该是那些做AI对话工具的厂商。现在不少厂商都推出了AI心理支持功能,但之前没人能说清这些功能到底“靠谱不靠谱”,是真能帮到用户,还是反而添乱。MentalHealthBench能给他们一个明确的参考,指出自己产品在心理健康场景里的短板,比如是不是经常说些没营养的套话,有没有潜在的安全隐患,然后针对性优化。
其次是用AI心理工具的普通用户。以后选AI心理服务时,除了看品牌宣传,还能参考它在这个bench上的表现,不用再摸着石头过河。
对行业来说,这也是个信号:AI心理健康服务终于有了专门的评测标准,不再是没人管的灰色地带。
最后想问个有点纠结的问题:当AI的心理健康回复被严格套上“安全”和“有用”的标尺,会不会反而让AI变得小心翼翼,失去了能真正共情的温度?
素材来源:OpenAI News · AI情报、AI应用落地、AI政策与监管
查看报道原文

发表第一条评论吧