桃子桃子快讯
←返回首页
开源

Swift-1.5-Qwen3.8-Flash-Next 实测:推理 token 砍至 40%,质量几乎持平

Reddit 用户实测显示,UkisAI 发布的 Swift-1.5-Qwen3.8-Flash-Next 在 Aide…

2026.09.26 · 周六约 4 分钟阅读

Reddit 用户 r/returnity 在 r/LocalLLaMA 发布了一篇针对 UkisAI 团队微调版本 Swift-1.5-Qwen3.8-Flash-Next 的实测报告,使用与原版相同的 Aider agentic 编程基准进行对比,重点考察 token 消耗、墙钟时间与质量变化。整体结论是:Swift 版本在质量几乎不打折的前提下,把推理开销压到原版的约 40%。

基准设置

作者日常使用 Q5_K_L 量化(配 Q8_0 engrams)以保证 128GB 显存下 262k 上下文,对照组采用 Unsloth 的 Q5_K_XL 量化(同样 Q8_0 engrams),推理档位均为 xhigh。所有数据来自同一套 Aider 基准,覆盖一次通过率、重试通过率、单例 token、墙钟、tok/solve 与 well-formed diff 等指标。

总体结果

指标原版 Qwen3.8-Flash-NextSwift-1.5-Qwen3.8-Flash-Next
首试通过率40.2%41.1%
重试通过率90.7%86.9%
tokens/case176466991
sec/case1542608
tok/solve24.8K10.5K
well-formed diff98.1%100.0%

作者指出,首试与重试通过率差异在 4% 以内,考虑到样本噪声并不具备统计显著性。简单问题表现基本持平,差距集中在需要二次尝试的最难题目:原版在重试场景下恢复 84% 的用例,Swift 恢复 78%。

节省幅度

  • 单用例 token:中位数 6991 vs 17646,约为原版 40%。
  • 墙钟时间:中位数 608 秒 vs 1542 秒,同样约为原版 40%。
  • 最费 token 的 20 个用例上,Swift 用了 29% 的 token,但解出 16/20,原版 17/20,质量损失极小。
  • 单一用例最大 token:Swift 上限约 44k,原版可达 203k。

作者特别提到原版在高难度题目上常出现「推理上头」式的来回打转,Swift 几乎不会发生。

分语言差异

按 C++、JavaScript、Python 拆分通过率(首试 / 重试)

  • C++:原版 23.1% / 84.6%,Swift 30.8% / 73.1%,token 压缩最显著(仅 29%),但也承担了 3/6 的质量损失。
  • JavaScript:原版 37.5% / 91.7%,Swift 41.7% / 93.8%。
  • Python:原版 57.6% / 93.9%,Swift 48.5% / 87.9%。

配对分析(n=107)显示 99 例一致、2 例 Swift 占优、6 例落后(净 -4),McNemar 精确检验 p≈0.29,差异不显著。

总结与适用场景

Swift-1.5-Qwen3.8-Flash-Next 对本地运行 Qwen3.8-Flash-Next 的用户来说,几乎是「白拿」的效率提升:在质量统计学不可区分的范围内,把 token 与时间压到约四成。C++ 高负载场景需留意偶发的质量折损,其余主流编程语言基本可放心替换。

信源