工具
社区推出 Strata 推理引擎,12GB 显存跑通 Qwen3.8-Flash-Next
Reddit 用户发布自研推理引擎 Strata,可在 12GB 显存的 RTX 5070 上以约 65 tok/s 速…
2026.09.25 · 周五约 3 分钟阅读
一位 Reddit 用户近日发布了一款面向 Qwen3.8-Flash-Next 模型的自研推理引擎 Strata,让仅有 12GB 显存的消费级显卡也能流畅运行该模型。在 128K 上下文长度下,IQ3_XXS 量化版本可达到约 65 tok/s 的输出速度和约 430 tok/s 的 prompt 处理速度,相比此前基于 llama.cpp 的方案(约 15 tok/s 输出)有数倍提升。
硬件与测试环境
该方案针对的是一台典型的高性价比 PC 配置:
- 显卡:12GB 显存的 Gigabyte RTX 5070 SFF
- 内存:64GB DDR5(5600MHz)
- CPU:AMD Ryzen 5 7600
- 系统:Windows
开发者表示,引擎目前仅针对 CUDA 做了优化,低显存用户可以一键安装运行。
不同量化档位的性能数据
Strata 同时提供了多档低比特量化版本,在 128K 上下文下的速度对比如下:
输出速度(tokens/s):
- Q2_0(接近 unsloth Q3):65.1
- IQ2_XS(接近 unsloth Q4):52.0
- IQ3_XXS(接近 unsloth Q5):44.8
Prompt 处理速度(tokens/s):
- Q2_0:543
- IQ2_XS:472
- IQ3_XXS:414
值得注意的是,2-bit 量化版本(Q2_0、IQ2_XS)在该引擎下反而比 IQ3_XXS 更快,原因在于 RCO-GSQ 量化方法为更低比特做了额外优化。
显存与内存需求
要在 Strata 上运行各档量化模型,至少需要以下 RAM + VRAM 总量:
- Q2_0:约 37.6GB
- IQ2_XS:约 39.2GB
- IQ3_XXS:约 47GB
如果还要启用视觉编码器(vision encoder),需要额外预留 0.91GB。考虑到该方案采用 GPU + CPU 混合卸载策略,用户只需要一张 12GB 显卡即可部署完整的 Qwen3.8-Flash-Next。
项目资源
- 推理引擎(Strata):https://github.com/Niko1221/Strata
- 模型权重:https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
目前该项目由社区独立维护,尚未公布官方文档或第三方独立测试数据,对于希望复现性能的读者,建议先确认显卡驱动与 CUDA 版本兼容性。
