开源
POCKET-35B 发布:可在无 GPU PC 和手机上运行的 35B 模型
FINAL-Bench 在 Hugging Face 开源 POCKET-35B-GGUF 系列量化模型,主打 CPU…
2026.07.26 · 周日约 3 分钟阅读
社区团队 FINAL-Bench 在 Hugging Face 发布了 POCKET-35B-GGUF 系列的量化模型,主打「无 GPU 也能跑 35B」的本地推理路线,原生兼容 llama.cpp,无需 CUDA、无需云端。Reddit r/LocalLLaMA 上的发布帖宣称在 CPU 上可达到 59 tokens/s 的生成速度。
模型线与适配设备
该系列针对不同硬件档次给出了多档量化,覆盖 PC、mini-PC、Android 手机以及 iPhone/iPad/Mac。核心版本为 POCKET-35B-GGUF,提供 Q4_K_M、Q2_K、IQ1_M 三种量化档位。
- POCKET-35B-GGUF Q4_K_M:文件 21 GB,需 32 GB 内存的 PC 或服务器,主打最佳质量。
- POCKET-35B-GGUF Q2_K:⭐ 推荐档,文件 13 GB,可跑在无 GPU 的 mini-PC 上作为「日常主力」。
- POCKET-35B-GGUF IQ1_M:文件 8.2 GB,面向 16 GB 内存设备,强调最小体积下保留完整模型结构。
韩语与英语分支
在 35B 主线之外,作者还针对不同语言与平台推出了轻量分支。
- POCKET-KR-GGUF IQ2_M:5.1 GB,面向 Android 8 GB+ 内存的韩语手机用户。
- POCKET-KR-MLX 2-bit:5.1 GB,针对 iPhone/iPad/Mac 的 Apple Silicon 原生 MLX 路径。
- POCKET-EN-GGUF iPhone-mix:5.3 GB,配合 PocketPal 在 iPhone 上运行的英语版本。
- POCKET-EN-GGUF PC-mix:6.8 GB,PC 与 Android 通用的英语版本。
质量参考数据
原文以韩语 PPL(perplexity,越低越好)作为参考指标,公开的数值如下:
- Q4_K_M:5.79(最高质量档)。
- Q2_K:6.49(推荐档)。
- IQ1_M:9.69(最小体积档)。
- POCKET-KR IQ2_M / MLX 2-bit:7.95。
需要注意的是,更激进的量化(IQ1_M)会带来明显的 PPL 上升;英语版本未公布 PPL 数据。
实际意义与局限
POCKET-35B 走的是「在消费级硬件上跑得起」路线,对没有独立显卡的轻量设备用户有一定吸引力。Q2_K 档 13 GB 的体积与 6.49 的 PPL 折中较好,但 IQ1_M 档在 8.2 GB 体积下的 PPL 已升至 9.69,质量损失明显。当前发布以社区仓库为主,原始模型来源、技术细节与 token/s 性能的测试条件并未在帖中充分披露,建议读者参考 Hugging Face 页面获取完整信息后再做选择。
