桃子桃子快讯
返回首页
研究论文

AI 安全白皮书草案:政策制定者需关注的七大风险

一位研究者发布题为《政策制定者需了解的 AI 安全与安保问题》的工作草案白皮书,摘要列出当前大模型在攻击辅助、滥用防控、…

2026.07.27 · 周一3 分钟阅读

一位长期关注 AI 安全的作者近日发布了名为《What policy makers need to know about AI safety and security》的白皮书工作草案(working draft),全文约 39 页,已完成一定程度的外部审阅,作者在 Hacker News 上公开征询纠错反馈。该白皮书面向政策制定者,旨在将高度技术化的 AI 安全文献压缩为可快速消化的决策参考。

核心立场

白皮书在执行摘要(Executive Summary)中开宗明义:AI 是一套极其强大的技术,在带来新能力的同时也带来严肃的新风险。即便在非对抗场景下,AI 系统也可能严重行为失当,而攻击者可以通过构造输入诱导特定结果。作为典型的「双重用途」(dual-use)技术,AI 既可被攻击者直接用于生成误导性、不良甚至危险内容,也可成为网络攻防中的利器。

七大关键风险

白皮书执行摘要归纳了七条政策制定者必须关注的核心判断:

  • 现有模型已具备攻击实用性。 模型已能实施复杂网络攻击、制造逼真伪造内容,并生成涉及未成年人及非自愿第三方的露骨内容。
  • 阻止高水平使用者滥用模型并不现实。 对托管模型而言护栏(guardrail)仅有一定效果,且攻防对抗持续升级;开源权重模型行为不受约束且已足够强大,应将防控重点下移到滥用造成的后端影响(downstream impacts)。
  • 恶意 AI 生成内容的传播难以阻断。 一旦内容生成,即可通过既有渠道扩散;大量内容根本无法可靠检测,即便是 AI 生成的儿童性虐待材料(CSAM)等部分可检测场景,准确率也仍不完美。改善合法内容来源溯源机制,是缓解 AI 虚假信息的可行路径。
  • AI 模型表现出不可预测行为。 即便在非对抗场景下,模型也有可能行为失当并造成严重损害;在对抗场景下,能够向模型提供输入的攻击者可以刻意触发失当行为。目前尚无方法可完全消除该风险。
  • 使用 AI 模型意味着必须信任模型提供者。 使用托管模型需向提供者发送数据并信任其不滥用;本地模型相对更安全,但仍可能被不可信的第三方在训练阶段植入恶意行为。确保由可信方同时提供托管模型与开源权重模型,是降低恶意模型风险的关键。
  • AI 模型是强大的双重用途网络安全工具。 模型在软件漏洞的发现与利用上极为有效;尽管 AI 用于软件防护已有一定进展,但当前格局仍偏向攻击者,这一态势短期可能延续。
  • 智能体(agentic)AI 系统尚无完整安全方案。 任何时候模型一旦暴露于第三方输入——也就是几乎所有来自第三方的输入——其行为就变得不可信。当前最佳实践是默认模型会失当,并限制其可能造成的损害;这一原则在非对抗场景下同样适用,因为现有模型的不可预测性无法排除。

政策含义

白皮书在结尾指出,AI 技术过于强大,不应被放弃,也没有人愿意放弃。即便大模型本身的发展今日停滞——但并无证据表明会如此——人类社会也远未穷尽当前模型所提供的新能力,因此合法与恶意用户部署新 AI 系统的进程都将持续。管理这些风险,需要清晰理解 AI 系统的行为特征及其部署所处的环境。

完整 39 页 PDF 在 Hacker News 原帖中可下载获取。

信源