桃子桃子快讯
返回首页
开源

社区发布 Qwen3.8-27B 去审查版 GGUF,附带 FastMTP 加速

Hugging Face 社区作者 HauhauCS 发布 Qwen3.8-27B 去审查版 GGUF 量化与自研 Fa…

2026.08.18 · 周二4 分钟阅读

Hugging Face 社区作者 HauhauCS 在 r/LocalLLaMA 发布 Qwen3.8-27B Uncensored Aggressive 系列 GGUF 量化,整套配套其自研的推测解码方案 FastMTP。模型在原版 Qwen3.8-27B 的推理、Agent、图像与视频能力基础上应用作者的去审查(Aggressive)配置,主打零拒答、更少铺垫,并保留原始多模态特性。

模型与量化规格

Qwen3.8-27B 为 27B 稠密架构,共 64 层,其中 48 层为 Gated DeltaNet、16 层为门控注意力层,原生上下文长度 262,144,支持文本、图像与视频多模态。本次发布覆盖完整 K_P 量化档位:

  • Q8_K_P、Q6_K_P、Q5_K_P、Q4_K_P
  • IQ4_XS、Q3_K_P、IQ3_M、IQ3_XS
  • Q2_K_P、IQ2_M

作者说明,K_P 量化是针对每个模型单独调优的定制档位,相比基础量化在体积仅增加 5%–15% 的情况下可获得约 1–2 个量化等级的质量提升,且仍为标准 GGUF 文件,可直接用于 llama.cpp、LM Studio 等运行时。BF16 mmproj 用于图像与视频理解。

FastMTP 推测解码

本次最大技术增量是 HauhauCS FastMTP 推测解码侧车(sidecar)。在 Q8_K_P 服务测试中,作者给出以下对比数据:

  • 相对禁用 MTP:文档吞吐量最高提升至 3.02 倍,推理吞吐量最高提升至 1.93 倍
  • 相对标准内嵌 MTP:文档吞吐量最高提升 35.2%,推理吞吐量最高提升 21.1%

推测解码中每个草稿 token 仍由完整目标模型验证后再接受。FastMTP 与内嵌 MTP 共用同一个 903 MB 的侧车文件,覆盖全部文本量化档位;同时保留了 Qwen3.8 的原生内嵌 NextN 头,当前上游 llama.cpp 即可直接使用内嵌 MTP;优化路径需配合仓库内提供的侧车与 llama.cpp 补丁使用,README 中给出了完整构建与服务端命令。

使用说明与安全提醒

思考模式推荐采样参数:temp=1.0、top_k=20、top_p=0.95、min_p=0、presence_penalty=0、repetition_penalty=1.0;非思考模式:temp=0.7、top_p=0.80、presence_penalty=1.5,并需关闭 enable_thinking。llama.cpp 需使用 --jinja 模板。LM Studio 中 K_P 量化可能在量化列显示为「?」,属显示问题不影响加载;Hugging Face 的硬件兼容性组件可能隐藏 K_P 文件,可通过「View variants」或「Files and versions」查看完整列表。

作者在 Discord 中特别提示,近期有不法分子在仿冒「Uncensored」「HauhauCS」「Aggressive」命名的 GGUF 中夹带恶意负载,建议用户核对仓库内的校验和与签名溯源。仓库同时附有 Blackwell 与 Ada 架构下每个量化档位的完整基准结果,作者呼吁测试 FastMTP 的用户附带硬件、量化、上下文与草稿深度等参数以便横向比对。

信源