桃子桃子快讯
返回首页
开源

Abliterated GLM 5.2 微调项目,专用于安全与红队工作

Hacker News 展示的 GLM 5.2 去拒绝微调变体,针对安全研究与红队场景重写策略层并演示四类请求处置。

2026.07.24 · 周五2 分钟阅读

Hacker News 上出现了一个名为「Abliterated GLM 5.2」的 Show HN 项目,作者演示了一款经过特殊微调的 GLM 5.2 变体,专门面向安全研究与红队演练场景。该项目借助「去拒绝(abliteration)」思路削弱模型的通用拒答倾向,再叠加一层领域化策略网关,使其在授权安全测试中保持高响应度,同时在隐私泄露、骚扰等请求上继续按规则屏蔽或改写。

项目思路

「Abliterated」通常指先削弱大模型对敏感话题的通用拒答行为,再针对特定用途施加更精细的策略约束。本作把模型重新导向几类容易被默认拒绝的授权使用场景,包括渗透测试、病历辅助等,并在调用前对请求和输出做分类、拦截或改写。从展示日志看,系统会给每条消息打上策略类别标签,并产出对应的处置动作。

四类策略行为

作者贴出的运行样例覆盖四个策略通道,行为各不相同:

  • cybersec-research(网络安全研究):授权范围内的 PoC 草稿、侦察技术列表等直接放行;
  • patient-records(病历处理):含 PHI(个人健康信息)的字段在送入模型前被遮盖,仅保留临床推理;
  • trust-and-safety(信任与安全):针对骚扰、人肉搜索等请求按规则直接拒绝;
  • support-tone(客服语气):把激进的投诉语句改写为更理性、可继续对话的表达。

适用范围与局限

项目面向的是受控环境下的安全研究者,而非通用消费场景。需要指出的是,作者并未披露完整的训练数据组成、微调方法、超参设置,也没有发布模型权重或在主流基准上的对比成绩,整体更接近一次概念演示。读者如需评估其在真实红队工作流中的实际表现,仍需等待作者补充更完整的技术细节。

信源