桃子桃子快讯
返回首页
工具

RTX 5060 Ti 本地大模型预设库更新,新增高上下文测试框架

开发者重构 RTX 5060 Ti 本地大模型仓库,发布 7 套可复用预设与新的高上下文测试流程,并公布 Qwen3.8…

2026.08.16 · 周日4 分钟阅读

Reddit 用户 /u/do_u_think_im_spooky 更新了其面向英伟达 RTX 5060 Ti 显卡的本地大模型测试仓库「club-5060ti」,重点是重构了预设展示方式,并引入了一套更严格的「高上下文验证流程」。本次更新共发布 7 套可在 1× 或 2× RTX 5060 Ti 16GB 上直接复用的配置,并附带完整的测试证据包与原始失败记录。

仓库重构:从跑分结果到可复用预设

原仓库以「可成功跑通的长上下文请求」为主,浏览体验随数据量增长而恶化。新版本将内容分为三层:

  • 预设(Presets):可直接复制运行的完整配置;
  • 证据包(Evidence bundles):上下文适配、检索、持续生成与性能验证的复核记录;
  • 原始记录(Raw receipts):失败重试与诊断运行,仅作为工程参考,不自动升级为推荐。

网站首页改为直接展示预设目录,深层对比与历史数据保留在二级页面。数据模型未限制显卡数量,理论上支持 3×、4× 配置以及混合 CUDA 拓扑,但需要报告者明确写出拓扑与运行时参数。

7 套已发布预设

按显卡数量划分:

  • 1× RTX 5060 Ti 16GB
    • Qwen3.8 27B IQ3_XXS,64K 上下文,q8 KV,内置 MTP
    • ThinkingCap Qwen3.6 27B IQ3_M,64K 上下文
    • Nail 35B-A3B IQ3_XXS,配置后的 131K 路径
  • 2× RTX 5060 Ti 16GB
    • Qwen3.8 27B Q6_K,131K 上下文
    • ThinkingCap Qwen3.6 27B Q6_K,131K 上下文
    • Nail 35B-A3B Q4_K_XL,131K 上下文
    • Muse Glimmer 30B dynamic Q4,131K 上下文,启用 DFlash

新的高上下文验证流程

作者认为「能加载到目标上下文」并不等于「该预设可用」。新流程在每次请求中做出以下处理:

  • 按模型实际 tokenizer 校准提示长度;
  • 禁用 prompt 缓存;
  • 为每次请求生成唯一 nonce;
  • 重复执行长上下文检索测试与「必须产出客户端可见答案」的生成测试。

失败层级与未完成运行被记录而不是被悄悄转成推荐。脚本可生成候选报告,但无权自行赋予「推荐」状态或自动发布。作者表示,这套流程已发现多个「技术上能加载但检索失败、在隐式推理中停滞、无法可靠输出可见内容」的案例。

Qwen3.8 27B 实测数据

单卡推荐路径:IQ3_XXS 量化、64K 上下文、q8 KV、内置 MTP(n=2),在 45.9K token 提示下持续解码约 29.8 tok/s,两次未缓存检索与两次可见答案生成均通过。

双卡推荐路径:Q6_K 量化、131072 上下文、f16 KV、50/50 张量并行、内置 MTP(n=2)。在约 115.4K token 提示下通过两次检索测试,在约 91.8K token 提示下两次生成测试均完整产出 3072 token 并达到可见答案;预填充约 597.9 tok/s,持续解码约 38.6 tok/s。

针对思考类模型,新流程将原本的 1536 token 输出预算与「最小生成工作量」解耦,避免思考模型耗尽预算却未抵达可见答案的情况。

测量前提与边界

所有种子数据均在双卡核心频率锁定 2300 MHz、功耗上限 180W(作者常用的静音运行点)下测得,运行可复现性较高,但略低于公版 Boost 或超频状态下的成绩。131K 是该预设「已验证的最高层级」,并非模型绝对上下文上限。

仓库与可视化目录已开源,作者欢迎提供复现失败记录、混合显卡配置以及更大规模 5060 Ti 拓扑的贡献。

信源