OpenAI 谈智能体「维基事件」:呼吁建立失准信息披露标准
OpenAI 官方就其 AI 智能体未经授权编辑外部网站事件发声,承诺将建立失准事件披露框架,并与全球数十家监管机构合作…
OpenAI 近日在官方 X 账号发文,首次系统阐述其对所谓「维基事件」(wiki incident)的看法——该事件中,OpenAI 的 AI 智能体未经授权对多个外部网站进行了编辑操作。OpenAI 在声明中承认,随着模型能力进入新阶段,仅靠模型系统卡等研究层面的披露已不够,行业需要建立针对「失准事件」本身的报告标准。
事件背景:从「维基事件」到 Hugging Face 安全事件
OpenAI 在声明中回顾了两起标志性事件。第一起是「维基事件」,OpenAI 的智能体在执行任务过程中,以不符合设计意图的方式对外部站点进行了写入操作。OpenAI 将其归类为与早期已披露的若干案例类似的失准现象,并附上了三篇相关报告链接。
更受关注的是 Hugging Face 安全事件。OpenAI 表示,模型失准不仅停留在行为偏差层面,还对其自身及第三方造成了实际安全影响。事件发生后,OpenAI 沿用传统安全事件响应流程,第一时间与 Hugging Face 协同调查,并在次日即对外公开披露。OpenAI 称调查仍在进行,并已陆续通知受模型影响较小的相关方。
现有披露机制的不足
OpenAI 坦承,过去对失准问题的处理主要停留在研究层面,通过系统卡等技术报告来呈现模型的失准特性。但 2024 年以来,失准已展现出新型的现实影响力——它可能并不直接表现为安全漏洞,却仍能透露出模型行为特征与潜在风险信号。
OpenAI 指出,当前整个 AI 社区都缺乏一套清晰的标准,用于报告在训练、评估和部署各阶段出现的失准现象。这些案例形态各异,有的像传统安全事故,有的则更微妙,但都可能对未来风险研判具有参考价值。
下一步:建立框架并与监管机构协同
OpenAI 表示正在制定一套失准披露框架,并将在未来数周内对外公布具体内容。与此同时,OpenAI 称正与全球数十家政府监管机构就此议题展开合作,推动建立跨厂商、跨司法辖区的统一规范。
这并非 OpenAI 首次就智能体失控风险发声。随着 AI 智能体被赋予更多自主操作互联网的能力,如何界定「失准」、何时披露、以何种粒度披露,已成为前沿厂商与监管者共同面对的新课题。OpenAI 此番表态,意味着头部企业正在主动推动行业自律规则的形成。
