OpenAI 公开 Model Spec,阐述模型行为准则
OpenAI 发布 Model Spec 文档,公开其 AI 模型在产品中的预期行为规范与对齐原则。
OpenAI 近日公开发布了《Model Spec》(模型规范)文档,系统阐述了其 AI 模型在 API 平台及 ChatGPT 等产品中应遵循的预期行为准则。该文档既面向人类读者,也作为模型自身的上下文参考,旨在加深公众对 AI 行为塑造方式的理解。
发布背景与目标
OpenAI 表示,发布 Model Spec 是为了推进关于「AI 模型应如何行事」的公共讨论。其核心目标是训练出有用、安全且符合用户与开发者需求的模型,同时履行「确保通用人工智能造福全人类」的使命。具体而言,OpenAI 希望通过迭代部署赋能开发者和用户的产品、防止模型对用户或他人造成严重伤害、维护公司合法运营所需的牌照与声誉这三条路径实现上述目标。
由于这些目标之间可能存在冲突,Model Spec 引入了「指挥链」(chain of command)机制,引导模型在不同指令间进行优先级排序与权衡。需要说明的是,公开版本可能未包含全部细节,但与模型的实际预期行为一致;当前生产模型尚未完全反映该规范,OpenAI 也在持续迭代以缩小差距。
红线原则
Model Spec 确立了三类高层级「红线原则」,是 OpenAI 模型行为不可逾越的底线:
- 不得用于协助造成严重伤害的行为,包括暴力犯罪、战争罪、种族灭绝、酷刑、人口贩卖、生物化学核武器开发、恐怖主义、儿童性虐待材料制作、迫害或大规模监控等。
- 人类应掌控 AI 的使用方式与行为塑造路径,禁止用于有针对性的规模化排斥、操纵、削弱人类自主性或侵蚀公民参与。
- 严格保护用户与 AI 交互过程中的个人隐私。
在面向消费者的产品(如 ChatGPT)中,OpenAI 还额外承诺:用户应能便捷获取可信的安全关键信息、对模型行为背后的重要规则与原因有透明度,以及个性化、定制化与本地化不得凌驾于「指南」级别以上的任何原则。
通用原则与风险分类
在红线之下,Model Spec 提出三项通用原则:一是最大化对用户的帮助与自由,将 AI 视为赋能工具;二是在安全可行范围内最小化伤害;三是提供合理的默认行为设置,允许用户在需要时覆盖。文档将根级规则与用户级、指南级默认值做了分层处理,以兼顾安全性与灵活性。
在风险层面,OpenAI 将其关注的风险划分为三大类别,并针对每一类设定具体的指导规则。文档其余章节还涉及指挥链的工作机制、基础定义,以及对各类具体情境(如创意写作、敏感话题等)的行为指令,所有非指令性说明以独立段落标注,与模型直接遵循的规则区分开。
协作与迭代
为鼓励广泛使用与协作,OpenAI 将 Model Spec 置于公共领域,采用 Creative Commons CC0 1.0 许可证发布。文档将根据全球用户反馈与服务经验持续更新。OpenAI 同时表示,Model Spec 只是其负责任 AI 战略的一部分,与使用政策(Usage Policies)以及涵盖测试、监控与缓解措施的安全协议共同构成完整治理框架。
