桃子桃子快讯
返回首页
工具

OpenAI 发布 MentalHealthBench 覆盖心理健康全场景

OpenAI 推出 MentalHealthBench 评测基准,覆盖从日常倾诉到危机场景的完整心理健康对话谱系。

2026.09.24 · 周四2 分钟阅读

OpenAI 在其 X 平台官方账号上宣布推出一款名为 MentalHealthBench 的心理健康评测基准。该基准旨在弥补现有心理健康评测多聚焦于紧急危机情境的不足,覆盖用户向 AI 发起的完整心理健康对话谱系,涵盖从日常情感倾诉到急性危机等多种场景。

基准定位与覆盖范围

OpenAI 在发布说明中指出,目前大多数心理健康类评测基准集中于危机干预情境,难以反映真实使用中用户与 AI 助手互动的全貌。MentalHealthBench 的设计目标是覆盖更广泛的对话类型,使评测结果能够更真实地反映 AI 模型在心理健康支持场景中的综合表现。基准涵盖的具体对话层级包括:

  • 日常情感支持与倾诉类对话
  • 一般性心理健康咨询类对话
  • 急性危机情境类对话

背景与行业意义

随着 ChatGPT 等对话式 AI 产品被大量用于情感支持与心理健康相关对话,构建系统化的评测工具成为行业关注的重点。OpenAI 此次发布 MentalHealthBench,是其在 AI 安全与对齐领域持续投入的一部分,意在通过标准化基准推动模型在敏感场景中的可靠性评估。

待补充信息

截至目前,OpenAI 官方仅通过 X 平台短消息形式披露了基准的基本定位,尚未公开完整的技术报告、评测方法论、覆盖的具体模型范围以及初步评测结果等细节。MentalHealthBench 的论文或技术博客预计将在后续渠道发布,相关数据与对比结果有待进一步公开。

信源