桃子桃子快讯
返回首页
开源

SyzygyResearch 发布 Mach-1-Additive-35B 量化模型,35B MoE 压缩至 7GB

SyzygyResearch 在 Hugging Face 发布 35B MoE 模型的 GGUF 量化版,体积压缩至…

2026.08.20 · 周四2 分钟阅读

SyzygyResearch 在 Hugging Face 发布了 Mach-1-Additive-35B-GGUF 量化版本,将一个 35B 参数的 MoE(混合专家)架构模型压缩至 7GB 大小,可在移动端、边缘设备以及低内存系统上运行,消费级笔记本推理速度可达 120 t/s。同时配套发布了自定义的 llama.cpp 分支与多模态版本。

模型与量化方案

Mach-1-Additive-35B 采用 MoE 架构,原始参数规模为 35B。SyzygyResearch 通过自研的「Additive」量化方案将模型压缩至 7GB,使其能够:

  • 适配移动端与边缘设备部署;
  • 在低内存(low-memory)系统中运行;
  • 在消费级笔记本上实现最高 120 t/s 的推理速度。

官方信息显示,量化后体积相比原始 35B 模型大幅缩小,但具体量化比特数、精度损失以及基准测试数据尚未在发布说明中给出。

本次发布内容

本次同步上线的资源包括:

  • 文本版 GGUF:huggingface.co/SyzygyResearch/Mach-1-Additive-35B-GGUF
  • 多模态版 GGUF:huggingface.co/SyzygyResearch/Mach-1-Additive-35B-Multimodal-GGUF
  • 配套的自定义 llama.cpp 分支:github.com/SyzygyResearch/llama.cpp-mach1

自定义 llama.cpp 分支意味着该量化方案并非完全兼容官方主分支的推理流程,可能需要使用其修改版才能正确加载与运行模型。

后续规划

根据 SyzygyResearch 两周前发布的推文,团队表示 Laguna S2.1 与 Qwen 3.8 也将在后续陆续发布。社区可关注其 Hugging Face 主页与 GitHub 仓库以获取最新进展。需要注意的是,SyzygyResearch 并非主流大模型厂商,相关技术细节与基准成绩仍需独立验证。

信源