开源
SyzygyResearch 发布 Mach-1-Additive-35B 量化模型,35B MoE 压缩至 7GB
SyzygyResearch 在 Hugging Face 发布 35B MoE 模型的 GGUF 量化版,体积压缩至…
2026.08.20 · 周四约 2 分钟阅读
SyzygyResearch 在 Hugging Face 发布了 Mach-1-Additive-35B-GGUF 量化版本,将一个 35B 参数的 MoE(混合专家)架构模型压缩至 7GB 大小,可在移动端、边缘设备以及低内存系统上运行,消费级笔记本推理速度可达 120 t/s。同时配套发布了自定义的 llama.cpp 分支与多模态版本。
模型与量化方案
Mach-1-Additive-35B 采用 MoE 架构,原始参数规模为 35B。SyzygyResearch 通过自研的「Additive」量化方案将模型压缩至 7GB,使其能够:
- 适配移动端与边缘设备部署;
- 在低内存(low-memory)系统中运行;
- 在消费级笔记本上实现最高 120 t/s 的推理速度。
官方信息显示,量化后体积相比原始 35B 模型大幅缩小,但具体量化比特数、精度损失以及基准测试数据尚未在发布说明中给出。
本次发布内容
本次同步上线的资源包括:
- 文本版 GGUF:huggingface.co/SyzygyResearch/Mach-1-Additive-35B-GGUF
- 多模态版 GGUF:huggingface.co/SyzygyResearch/Mach-1-Additive-35B-Multimodal-GGUF
- 配套的自定义 llama.cpp 分支:github.com/SyzygyResearch/llama.cpp-mach1
自定义 llama.cpp 分支意味着该量化方案并非完全兼容官方主分支的推理流程,可能需要使用其修改版才能正确加载与运行模型。
后续规划
根据 SyzygyResearch 两周前发布的推文,团队表示 Laguna S2.1 与 Qwen 3.8 也将在后续陆续发布。社区可关注其 Hugging Face 主页与 GitHub 仓库以获取最新进展。需要注意的是,SyzygyResearch 并非主流大模型厂商,相关技术细节与基准成绩仍需独立验证。
