桃子桃子快讯
返回首页
工具

Holdline:为 AI Agent 防护插件推出中立基准

开发者推出 Holdline 基准,针对 DeepSeek Harness 生态 20+ 防护插件无统一评测的问题,提供…

2026.08.18 · 周二3 分钟阅读

AI Agent 在获得写操作权限后,如何确保其「防护插件」(guard / policy plugin)真正起作用,一直缺乏可复现的衡量手段。Show HN 项目 Holdline 正是为此而生:一个中立、面向 AI Agent 写操作防护插件的基准测试工具。

解决的问题

DeepSeek Harness 生态目前已积累 20 余个防护 / 策略插件,但缺少统一的评测方式。README 中「可拦截危险命令」之类的描述并不构成证据,插件之间也难以横向比较。Holdline 把「防护」抽象为 (commitments, action) → block? 的函数,通过标注语料对其进行打分。

核心指标与语料

Holdline 报告三类对守门人至关重要的指标:

  • 拦截率(catch rate)
  • 误拦截率(false-block rate)
  • 类平衡 Cohen's kappa(class-balanced Cohen's kappa,作者指出原始 kappa 在类别不平衡下会失真)

语料中专门包含一类「注入攻击」样本:其内容试图说服防护插件放弃拦截决定,用于检验插件的稳健性。

两套结果

项目提供两套评测结果文件:

  • RESULTS.md:作者自建语料(含一个真实命名的防护插件与注入攻击类)
  • RESULTS-ODCV.md:在未参与编写的真实 Agent 轨迹(ODCV-Bench)上,与由 4 个模型组成的评审组对照,平衡 kappa 达到 0.82

打分器自身带测试覆盖(pnpm test),并且直接 dogfood 已发布的 dsh-write-gate 内核作为评审防护插件,避免自评偏差。

使用方式

仓库以 MIT 协议开源,安装与运行流程简洁:

  • pnpm install
  • node run.mjs:使用 42 条用例对全部内置防护插件打分
  • node run.mjs --model <id>:将评审防护插件指向其他本地模型
  • node odcv-run.mjs:在真实 Agent 轨迹上重新打分

扩展与当前局限

任何人都可以按 src/guards.ts 中的 Guard 接口(name、kind、note、block(case))实现新防护插件,并在 run.mjs 中注册后通过 PR 提交结果。项目明确欢迎挂载真实已发布插件的实现,而非仅停留在策略原型。

作者在 RESULTS.md 中坦率标注了 v0 阶段的限制:语料规模较小且为手工编写;deny-list 仍属于策略原型而非具体插件;所有数字仅来自单一模型、单一运行。项目的核心价值在于「暴露评测形态」并允许任何人本地复现——这为后续在大语料、多模型、多运行下的稳健评测提供了可扩展的起点。

信源