开源
LocalLLaMA 用户集中发布多款大模型 GGUF 改造版本
社区用户 LLMFan46 发布 LongCat-Flash-Lite-Sparse、Qwen3.8-27B 等多个 G…
2026.08.30 · 周日约 3 分钟阅读
LocalLLaMA 社区用户 LLMFan46 近日集中发布了多款大语言模型的 GGUF 量化与社区改造版本,覆盖 LongCat、Qwen3 与 Laguna 等系列,并附带 llama.cpp 补丁分支与 J-Wash 工具增强。这些发布均为个人维护的非官方版本,重点在于本地推理兼容性与适配 llama.cpp 生态。
LongCat-Flash-Lite-Sparse:稀疏注意力与 1M 上下文
LongCat-Flash-Lite-Sparse 是在原版 LongCat-Flash-Lite(69B-A3B 参数规格)基础上的社区改造版本,新增两项关键能力:
- 稀疏注意力(sparse attention),区别于原版的稠密注意力
- 上下文长度扩展至 1M(原版为 256K)
由于改动尚未合并进 llama.cpp 上游主线,用户需使用作者维护的 fork 才能加载对应 GGUF 文件。该模型同时提供两个去审查(Heretic)变体:
- Uncensored Heretic:100 次测试中 9 次拒绝,KLD 为 0.0157
- Ultra Uncensored HJeretic:100 次测试中 4 次拒绝,KLD 为 0.0779
两个变体均保留了原生 MTP 与 LSA 支持。
Qwen3 系列多规格发布
作者针对 Qwen3 系列同步放出多款版本:
- Qwen3.8-27B Ultra Uncensored Heretic:保留 MTP,同时提供 Safetensors、GGUF、NVFP4、NVFP4-GGUF、GPTQ-Int4 等格式;100 次测试中 3 次拒绝,KLD 为 0.0244
- Qwen3.5-122B-A10B Uncensored Heretic:保留 MTP,仅发布 GGUF 版本;100 次测试中 8 次拒绝,KLD 为 0.0856
- Qwen3-Coder-Next:面向代码任务的版本,仅发布 GGUF,按社区用户需求制作
Laguna-S2.1 与工具链更新
Laguna-S2.1 在原版本基础上加入 Vision 能力。作者提示视觉部分仍不完善,不需要多模态的用户可省略 mmproj 文件,模型将以纯文本模式正常运行。
同步更新的 J-Wash Enhanced 分支包含:
- 新增对 Qwen3.5/3.6/3.8 系列 MoE 模型的支持
- Bug 修复与 UI 改进
所有模型文件均托管在 Hugging Face 用户 llmfan46 名下,llama.cpp 补丁与 J-Wash 增强版见其 GitHub 仓库。需说明的是,这些版本均属社区第三方改造,并非官方发布,使用前应自行评估安全性与适用性。
