桃子桃子快讯
返回首页
开源

BTL-3:27B 开源权重编码智能体模型发布

Bad Theory Labs 发布基于 Qwen3.6-27B 的开源编码智能体模型 BTL-3,BFCL v4 达…

2026.07.24 · 周五4 分钟阅读

Bad Theory Labs 在 Hugging Face 发布开源权重模型 BTL-3,定位为面向智能体编码、结构化工具调用与长链路多轮执行的 27B 模型。该模型以 Qwen3.6-27B 为基座,通过 RL-0013 阶段的强化学习与 LoRA(rank 32, alpha 64)适配器完成训练,并以 Apache-2.0 协议开放权重,可与 Transformers 或 vLLM 搭配部署。

模型概览

BTL-3 是一份「后训练」而非从头训练的模型:基座权重来自 Qwen3.6-27B(固定版本 6a9e13bd6fc8f0983b9b99948120bc37f49c13e9),在此基础上叠加一个约 934 MB 的 PEFT(LoRA)适配器。官方推荐启用思考模式(thinking mode)以获得最佳的编码与推理表现。

为便于本地推理,团队同时发布 BTL-3 Compact,将完整文本模型打包为单个 8.39 GB 的原生文件,按权重规模折算相当于每参数约 2.5 比特。在一项 100 轮的私有工具契约测试中,Compact 版本保留了完整模型 83/90 的正确行为(即 92.2% 的条件性工具行为留存率)。

关键能力与基准

BTL-3 的核心强项在于结构化工具调用与编码任务,主要基准成绩如下(均为 RL-0013 冻结版本):

  • BFCL v4 AST:88.5%(1097/1240),覆盖完整官方测试集
  • HumanEval:95.12%(156/164),思考模式 pass@1
  • LiveCodeBench v6:88.1%(170/193),思考模式
  • BigCodeBench-Hard 严格 pass@1:26.35%(39/148)
  • BigCodeBench 功能级测试:59.25%(506/854)

BFCL v4 分类表现中,「Simple」类 93.2%,「Multiple」类 95.5%,「Parallel」类 87.0%,「Parallel-multiple」类 70.0%,「Irrelevance」类 91.2%——后者衡量模型在不应调用工具时主动避免调用的能力。模型架构上延续 Qwen3.6 的混合注意力设计,声明上下文窗口 262,144 tokens,实际推理与基准评估时最大序列长度分别为 65,536 与 32,768 tokens。

部署与使用

官方给出两种主流部署路径:

  • Transformers + PEFT:加载基座后挂载 badtheorylabs/BTL-3 适配器即可推理,支持 enable_thinking=True 进入思考模式。
  • vLLM 0.23.0:通过 --enable-lora--lora-modules 启动服务,需指定 --lora-target-modules 覆盖 Qwen3 注意力和 MLP 投影层,并启用 --reasoning-parser qwen3。结构化工具调用依赖所安装 vLLM 版本自带的 Qwen XML 工具解析器。

适配器文件 adapter_model.safetensors 的 SHA-256 为 37a8f519039707eba5906591cdb14268768db43f80489a9c2f83b3e51e5e89db,便于校验完整性。官方同时强调,生成的代码与工具调用应当在沙箱中执行,对破坏性、特权或财务类操作需显式确认。

许可与适用场景

BTL-3 适配器以 Apache-2.0 发布,但需配合单独分发的 Qwen3.6-27B 基座模型使用。官方列出的目标用途包括编码与调试、仓库与终端代理、结构化函数调用与多工具工作流、私有或自托管代理部署,以及需要验证与恢复的长链路多轮任务。社区反馈与后续更新可通过 Bad Theory Labs 官网及其 Discord 频道获取。

信源