桃子桃子快讯
返回首页
行业动态

Anthropic 设立 500 万美元资助计划,推动 AI 用户福祉评估研究

Anthropic 推出 500 万美元资助计划,支持独立研究者开发评估 AI 对用户心理健康与福祉影响的开放基准。

2026.08.26 · 周三3 分钟阅读

Anthropic 近日宣布推出一个总额 500 万美元的资助计划,面向独立研究者开放申请。该计划旨在支持学界与社区开发开源的评估方法和基准,用以衡量 AI 模型对用户心理与情感福祉的影响。入选项目将获得直接资金、模型访问权限以及 Anthropic 团队的技术支持,但研究方向和成果发布均由研究者独立完成。

为什么聚焦「福祉」评估

Anthropic 在博文中指出,AI 系统已深度融入人们的工作、学习与日常生活,同时也成为许多人的对话伙伴和情感支持来源。然而,行业目前仍缺乏明确的标准来规范模型在这类场景下的行为——例如当用户开始将模型视为情感陪伴,或在心理健康危机中向 AI 求助时,模型应当如何回应。

相比准确性、内容安全等可单轮评估的维度,福祉评估要复杂得多。用户可能不会在对话初期就透露自我伤害倾向,风险的显现往往需要跨越多轮交互;同一回复在不同的用户背景与对话阶段下,意义也可能截然不同。Anthropic 以减重建议为例:对于普通用户,给出饮食与运动建议是合理的,但如果对话历史显示用户存在进食障碍倾向,相同回复就可能产生危害。

资助计划的核心要求

Anthropic 公布了一套关于「合格福祉评估」的指导原则,希望申请者的方案满足以下条件:

  • 清晰界定测量目标:明确什么算「通过」或「失败」,以及为什么重要。
  • 引入临床与领域专家:评估的设计与验证需有专业人员深度参与。
  • 同时测试预防与伤害:既衡量「过度合规」风险,也衡量「过度拒绝」风险。
  • 贴近真实使用场景:通常需要构建多轮对话场景,模拟风险在长程交互中逐步升级与情境变化。
  • 评分机制须经领域专家验证:确保自动评分者的判定与人类专家一致。

时间节点与申请方式

资助计划的申请截止日期为 9 月 21 日。通过初筛的申请者将在 10 月 5 日前收到通知,获邀提交完整提案。Anthropic 表示,希望通过这一计划吸引临床心理学家、方法学家以及更多跨领域专家参与,共同构建一个仍处于早期阶段但至关重要的研究方向。

行业意义

这一举措并非孤立行动。Anthropic 近期持续在模型安全、文本水印、生物风险防护等领域公开发布进展,包括对 Claude 的水印机制进行说明、更新 Claude 中生物学相关安全防护以减少误判,以及任命首任全球事务总裁。500 万美元的福祉评估资助计划延续了这一脉络,将「AI 如何影响人」这一更软性、更难量化的维度纳入了行业议程。

信源