桃子桃子快讯
返回首页
开源

社区玩家修补 Ornith1.5 35B A3B MTP 头:任务耗时降三成

Reddit 用户将训练好的 MTP 头移植到 Ornith1.5 APEX 重量化版上,使任务完成时间缩短 33%,并…

2026.08.22 · 周六3 分钟阅读

Reddit r/LocalLLaMA 社区用户近日发布了一项针对本地模型 Ornith1.5 35B A3B 的优化方案:通过把在其他量化版本上训练好的 MTP(Multi-Token Prediction)头「移植」到 APEX 重量化版本上,使该模型在其业余无线电自动化测试中的任务完成时间缩短了约 33%。作者已将量化模型与测试方法公开发布,供社区复现。

优化思路:跨量化版本「拼接」MTP 头

Ornith 35B A3B 系列是社区维护的本地大模型,此前发布的 1.0 版本已被作者用于驱动其 HAM 无线电设备(hackRF 接收机 + 5W Quansheng 手台)。在试用官方推出的 Ornith1.5 构建时,作者发现其速度与准确率均优于 1.0,但社区讨论指出 1.5 的 MTP 头并未经过训练。作者随后在某个无法直接使用的量化版本中找到了一个已训练好的 MTP 头,将其「拼接」到基于 Ornith1.5 的 APEX 重量化版本上,得到一个组合型构建。

性能对比

  • 相对 Ornith1.0:综合速度约为 2.5 倍。
  • 相对官方 Ornith1.5:同一组「无线电压测」任务平均耗时从 21 秒降至 14 秒,减少约 33%。
  • 绝对吞吐:平均 tokens/sec 仅由 60 提升至 64(+3%),但首 token 延迟与任务整体完成时间显著缩短。

作者指出,单纯看 t/s 数字会低估实际收益——MTP 头对生成步数和响应结构的影响主要体现在 wall clock time 上,而非峰值吞吐。

应用场景与发布

作者的测试场景是让模型自动化操作业余无线电发射链路,包括在授权频段上按键发射;据其描述,优化后的模型「不会在执行这类指令时反过来教训用户」。该版本已在 Ollama 模型库发布:

局限与适用范围

需要注意的是,Ornith 并非主流厂商模型,本次结果来源于个人非标准化测试,硬件环境(GPU 型号、推理后端、量化精度)未在帖子中完整披露。MTP 头拼接对其他模型是否同样有效,取决于该模型在训练阶段是否使用了 MTP 目标以及 MTP 头是否以独立权重形式保存,因此该方案的可迁移性尚需更多验证。对于使用 Ornith 系列本地部署无线电控制、自动化脚本等场景的用户,作者公开的构建可能值得一试。

信源