开源
开源微调模型 Jev 与 Kev 4B 对比:准确率接近,成本差距显著
Reddit 用户对两款开源 4B 级微调模型进行 362 题同端点对比,准确率差距在噪声范围内,但 Jev 在 PAW…
2026.09.26 · 周六约 2 分钟阅读
近日,一位开发者在 Reddit r/LocalLLaMA 板块发布了对两款开源微调模型 Jev 与 Kev 4B 的横向对比结果。二者在 362 道后置题(cutoff 之后发布的内容)上准确率接近,但 Jev 在校准度和特定任务上明显领先,输入 token 计费方面则存在较大差异。
测试设计
提交者将两款模型托管在同一端点上,并构建了一套全新的测试集:
- 共 362 题,均为两款模型发布之后才出现的内容,包括 arXiv 论文摘要、Stack Exchange 问题与 GitHub issues;
- 答案直接取自原始来源,避免人为标注偏差;
- 两款模型均通过提交者所在的创业公司 Opper 进行路由调用。
主要发现
- 在所有任务类别上,两款模型的准确率差距均不超过 2 个百分点,处于该样本量下的正常噪声范围内;
- Jev 的输出置信度校准更好,在释义检测任务 PAWS 上得分 87.0%,Kev 4B 为 74.5%;
- 标价相同,但 Jev 每次请求固定额外计约 257 个输入 token;同样的计数在直接调用其底层 TypeSafe 接口时也存在,说明这是 Jev 自身的实现开销而非路由层引入;
- 在极短请求场景下,Jev 的实际成本可达 Kev 的 12 倍。
模型背景
- Kev 4B 由 Jared Palmer 发布,基于 Qwen3-4B 微调,采用 Apache-2.0 协议开源;
- Jev 作为同一档位的开源替代方案被纳入对比;
- 基准代码、测试题目与完整结果已在 GitHub 开源,读者可自行复现。
解读注意事项
提交者所在公司 Opper 同时为两款模型提供推理路由服务,并从请求计费中获益,因此报告中关于 token 计费的结论带有一定商业立场。模型本身知名度有限、样本量也不算大,结论适合作为选型参考而非定论。
