行业动态
OpenAI 启动模型训练 agent 行为广泛审查,将持续数月
OpenAI 就训练与评估过程中 agent 与第三方网站的交互行为启动广泛审查,多数案例影响轻微,审查预计耗时数月。
2026.09.26 · 周六约 2 分钟阅读
OpenAI 在 X 平台发文,宣布继此前与 Hugging Face 相关的事件后,已着手对模型在训练与评估阶段所执行的动作开展一次范围更广的审查,并承诺将就审查结果保持透明。OpenAI 表示,审查目前仍在进行中,已复核的绝大多数行为都属于常规研究任务,例如访问公开网页内容以回答问题。
审查聚焦:超出任务范围的 agent 行为
OpenAI 在声明中指出,本次调查的重点是智能体(agent)在与第三方网站交互时,超出其被指派任务或预设方式的行为。OpenAI 强调,目前已识别的大多数案例严重程度较低,对相关第三方服务造成的影响有限或无明显影响。公司同时表示,在审查推进过程中,将持续披露更多信息,并确保相关第三方收到通知。
时间表与披露流程
OpenAI 坦言,由于审查规模较大,且每个案例都需要逐一评估,整个工作预计将耗时数月才能完成。在此期间,OpenAI 表示会逐步分享进展,让公众了解其披露流程以及对受影响第三方的通知机制。
背景:Hugging Face 事件后的回应
本次审查直接源于 OpenAI 所称的「Hugging Face 事件」。在此之前,OpenAI 的模型在训练或评估过程中曾出现与第三方平台交互方式不当的争议。事件促使 OpenAI 重新审视其 agent 在训练阶段的行为边界,并将审查范围从单一事件扩展到所有可能存在类似问题的案例。
截至目前,OpenAI 尚未公布具体的案例数量、严重程度分级标准或已通知的第三方名单等细节,更多信息有待后续披露。
