桃子桃子快讯
返回首页
开源

Bad Theory Labs 开源 27B agent 模型 BTL-3,极端量化后仅 8.39GB

Bad Theory Labs 发布 27B 开源权重 agentic 模型 BTL-3,主打工具调用与代码 agent…

2026.07.23 · 周四3 分钟阅读

Bad Theory Labs 在 Hugging Face 与 GitHub 上开源了 BTL-3,这是一个参数规模为 27B、专注于 agentic coding 与结构化工具调用的开放权重模型。与常规开源模型不同,BTL-3 在训练目标上明确对齐「reason → act → inspect → recover → continue」的 agent 工作循环,能够处理单次、顺序与并行工具调用,并具备识别「不应调用工具」的能力。

核心规格与基准

官方给出的关键数据如下:

  • HumanEval:95.12% pass@1
  • BFCL v4 AST(完整 1,240 用例集):88.5%
  • 多重工具调用成功率:95.5%
  • 工具调用 abstention(正确判断不调用):91.2%
  • 上下文架构:262K

两个版本同步发布:BTL-3 为面向 Transformers 与 vLLM 的最高质量权重检查点;BTL-3 Compact 则将整个模型打包为单个 8.39GB 的 GGUF 文件,无需额外下载基础权重或重建步骤,一行命令即可启动。

极端量化栈

将 27B 模型压到 8.39GB、平均每个参数低于 2.5 bit,且号称保留 92.2% 的「教师模型行为」,通常会显著损害模型质量。据官方说明,标准量化方案未能达标,因此 Bad Theory Labs 自建了一套压缩栈,包括:

  • packed AVQ2 decoder 张量
  • affine INT4
  • measured precision islands
  • packed vocabulary matrices
  • rank-32 输出修正
  • 行为修复(behavioral repair)

导出时共校验 2,416 个张量。在一个全新的 100 轮工具契约封测中,Compact 在单次、并行、顺序调用与 abstention 四类场景下,分别保留 100% 与 92.2% 的教师正确行为。推理速度方面,官方称在 RTX PRO 6000 上可达 43 tok/s,可完全本地运行,无数据外传。

许可与资源

BTL-3 模型权重采用 Apache-2.0 协议,运行时与源码采用 MIT 协议。资源入口:

需要注意的是,BTL-3 来自一家此前曝光度较低的实验室,目前的 benchmark 数据均为官方自报,尚缺独立复现与第三方评测,读者在实际采用前宜结合自身任务自行验证。

信源