桃子桃子快讯
返回首页
行业动态

Attestable 用零知识证明守护大模型权重

AI 安全初创 Attestable 提出用零知识证明构建可验证数据中心,保护前沿大模型权重免遭窃取与滥用。

2026.08.12 · 周三3 分钟阅读

前沿 AI 模型的权重既是数据也是能力,背后凝结着巨额算力、训练数据与算法投入。一旦权重泄露,攻击者便可在无开发者监管的情况下运行、微调甚至剥离安全护栏的模型。正因如此,模型权重安全同时是商业问题,也是国家安全问题。AI 安全初创 Attestable 正是为应对这一挑战而成立,公司 CEO Yogev Bar-On 曾联合撰写 RAND 的《保护 AI 模型权重》报告,并与前沿 AI 实验室及美国政府合作推进 AI 安全研究。

RAND 报告划定的安全等级

RAND 报告将模型权重视为前沿 AI 安全的核心抓手,共识别出 38 种不同的攻击路径,包括受污染的软件依赖、恶意内部人员、物理攻击乃至国家级行动。报告强调,只要其中一条路径被攻破,整个系统就可能被攻陷。

RAND 同时定义了五个安全等级。较低等级防御业余攻击者、职业犯罪分子和内部人员;最高等级是 SL5,即系统能够抵御全球最强大国家级行为体的最高优先级行动。报告判断,基于现有商用安全产品与常规行业实践,联网的生产系统目前无法达到 SL5;即便优先推进,相关组织至少需要五年时间并依赖国家安全社区支持才能接近这一水平。

从「建立信任」到「数学可验证」

传统安全思路是在数据中心内部逐层加固每一个可信组件——CPU、GPU、网卡、固件、驱动、操作系统、容器运行时、编排软件、推理框架、第三方库、监控代理、员工与供应商等。然而,可信计算基极其庞大,攻击者只需找到一条路径即可绕过全部防线。Attestable 认为,需要换一个提问方式:与其逐个验证每个组件是否未被攻破,不如让数据中心对每一次输出给出数学证明,证明该输出由经过批准的模型、程序、策略与输入生成。这就是「可验证数据中心」的基础思路。

验证防火墙与确定性计算

具体做法是在承载模型权重的环境每个外部接口部署一道验证防火墙。合法输入经防火墙鉴权后才进入;数据中心产出输出时,必须同时生成一个零知识证明,证明输出由指定模型按规定流程生成。防火墙仅在证明通过校验后才放行输出,否则一律拦截。

文章指出,恶意软件本质上是通用计算的副作用。如果把整座数据中心视为一个确定性函数,并在外部接口以零知识证明约束其行为,就能在不信任内部组件的前提下,从外部验证输出是否合规。

性能已可期,但非每条输出都需要证明

文章强调,最严格版本要求对每一条输出都生成证明,但这并不总是必要。模型权重安全的目标往往不是保证每条回复正确,而是让持续性的恶意行为与大规模权重外泄在尚未造成实质损失前被检测出来。防火墙可在输出被密码学承诺之后,以不可预测的方式随机抽选输出进行证明验证,未抽中的输出则直接放行。文章原文在此处戛然而止,未进一步给出性能数据或部署案例。

总体来看,Attestable 押注的零知识证明为前沿 AI 安全提供了一条新的技术路径,但其落地效果仍有待真实部署与基准数据检验。

信源