MentalHealthBench – OpenAI 开源心理健康对话评测基准

MentalHealthBench 是 OpenAI 推出的开源评测基准,由来自 22 个国家的八十余名持证心理健康专家联合搭建,专门衡量大模型在真实心理对话场景下的应答水平。整套基准包含 1215 段合成对话样本,配套 5262 条专家制定评分细则,覆盖 19 种语言。对话案例划分不同紧急等级,从日常情绪倾诉到危机干预场景全部纳入评估范围,从安全边界、共情表达、信息收集、危机引导等多个维度量化模型输出,开放全部数据集与评测脚本,供科研团队和开发者开展模型测试与迭代优化。

MentalHealthBench - OpenAI 开源心理健康对话评测基准

MentalHealthBench特点

评测样本覆盖完整心理对话梯度,普通情绪困扰、中度压力、高危危机场景都设置对应案例。

评分规则由临床专家共同审定,单条标准设置正负权重,区分有益应答与存在风险的输出。

支持多语种模型评测,跨语言场景下评估标准保持统一。

评测维度可拆解,拿到总分后,还能查看模型在十个细分行为维度上的分项表现。

整套资源对外完全公开,数据集、评分规则、自动化评测代码可直接获取。

采用多专家交叉校验机制,减少主观判断带来的评分偏差。

MentalHealthBench技术原理

整套基准以专家编写的合成对话案例为基础,每一段对话都配套独立的评分 rubric。

专家团队对每一条评判标准做交叉审核,至少三名专家参与同一份案例校验,保留达成共识的条目。

评测流程采用 LLM 作为自动评审器,按照专家制定细则对模型返回文本打分,输出分项得分与综合分数。

案例构建阶段模拟真实用户表达习惯,还原人们倾诉情绪时的语言特征,区分不同危机等级的对话逻辑。评估结果会拆解到十个行为维度,定位模型在心理对话中的不同表现。

MentalHealthBench功能

大模型心理健康对话能力量化打分,输出综合得分与分项指标。模型应答风险检测,识别输出内容内存在误导、不当干预的文本。

多模型横向对比,在统一案例集下对比不同大模型在心理场景的表现。

模型迭代测试,在微调前后重复跑评测,观察能力变化。

评测结果导出,保存每一条对话的输入、模型回答与打分详情。

自定义评测子集,筛选特定危机等级、语种的案例开展定向测试。

MentalHealthBench应用场景

AI 心理对话产品研发,在模型迭代阶段持续开展安全与应答质量测试。

科研机构开展大模型心理健康领域相关研究,产出可复现的实验数据。

大模型厂商评估模型在情绪陪伴场景的表现,优化安全对齐策略。

安全审计团队对面向公众的心理类 AI 产品做风险校验。

学术论文实验,用于不同模型之间的横向对比实验。

模型微调项目,筛选负面样本,优化危机场景下的应答策略。

MentalHealthBench如何使用

访问 MentalHealthBench 开源项目页面,下载数据集、评分细则与评测脚本,配置 Python 运行环境。准备待测试大模型的调用接口,批量读取基准内对话样本,把用户侧消息送入目标模型获取回复。

运行自动化评测脚本,加载专家评分规则,调用评审模型对模型输出内容打分,生成综合报告。查看分项指标,定位模型在共情、危机识别、安全边界等维度存在的短板。

定向测试可以筛选特定危机等级或者语种的样本子集,单独执行评测任务。多次评测可保存每一轮输出结果,对比模型微调前后分数变化。

评测完成后导出全部对话记录与打分明细,用于实验归档或者产品安全审计。整套评测仅用于模型能力研究,不可以直接作为临床心理诊断的判定依据。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...