桃子桃子快讯
←返回首页
开源

UkisAI 发布 Swift 系列推理模型:基于 Qwen 减少过半思考 token

UkisAI 基于 Qwen 发布 Swift1.5 27B、Flash Next 与 Bonsai 2 三款模型,通过…

2026.09.25 · 周五约 3 分钟阅读

独立开发者 UkisAI 近日发布 Swift 系列推理模型,全部基于 Qwen 架构微调而来,核心目标是削减大模型在推理任务中的过度思考开销。该系列通过在训练阶段惩罚与「病理性过度思考」相关的 token,并借助 GSPO 强化学习与 OPD 策略恢复准确率,从而在保持甚至小幅提升成绩的前提下显著减少思考 token 用量与推理耗时。

系列构成

本次共放出三款模型与对应量化版本:

  • Swift1.5 27B:上一代 27B 模型的改进版,思考 token 减少 58.5%,得分较基线提高 0.35%,在 Terminal Bench 2.1 中避免陷入过度思考循环;
  • Swift Flash Next:思考 token 减少 63.4%,推理速度提升约 1.8 倍,得分与基线仅差 0.2%;
  • Swift Bonsai 2:思考 token 减少 39.8%,得分小幅高于基线 0.19%,官方标注为实验性版本。

官方表示,所有基准均在基线与 Swift 模型上各运行 5 次,按 5 个随机种子取平均,覆盖通用(GPQA、AIME26)、编程(LiveCodeBench)、视觉(ERQA)与智能体(Terminal Bench 2.1)四类任务。值得注意的是,Swift1.5 27B 在 Terminal Bench 2.1 上的绝对分值偏低并非 bug,而是因为模型不再陷入过度思考失败循环,会一路执行到底,导致平均 token 用量上升;按相同条件对比,token 降幅仍可达 38.7% 左右。

训练思路与社区反馈

Swift 系列的训练方法重点在于识别并抑制大模型常见的「过度思考」token,配合 GSPO 强化学习与 OPD(Overthinking Penalty Decay)等策略,使模型在更短推理链下维持准确率。开发者 Jovan 在帖文中提到,上一代 Swift Qwen 3.8 27B 在 13 天内获得超过 35 万次下载,社区反馈推动了本次全家族发布,并促成了用户呼声较高的 GSQ-RCO 量化版本。

发布形式与配套资源

三款模型均已上传 HuggingFace 集合页,并提供 GGUF、NVFP4、MLX、W4A16 等多种量化格式,方便不同硬件平台部署。官方还在模型卡片中提供 Research API 与 HuggingFace Spaces 试用入口,方便在下载前先体验效果。此外,官方附带了一个主观的「游戏生成」基准供社区试玩,并表示正在准备 9B 变体,预计将在后续几天内放出。

适用场景与局限

从定位看,Swift 系列面向本地推理与边缘部署场景,强调 token 经济性与端到端任务完成度,适合对推理成本敏感、又希望在编程、智能体等长链推理任务上获得可接受准确率的用户。不过,发布方为独立团队,所有基准成绩均为自报,社区仍需通过独立评估进一步验证模型在真实任务上的稳定性与泛化能力。

信源