桃子桃子快讯
返回首页
开源

POCKET-35B 发布:可在无 GPU PC 和手机上运行的 35B 模型

FINAL-Bench 在 Hugging Face 开源 POCKET-35B-GGUF 系列量化模型,主打 CPU…

2026.07.26 · 周日3 分钟阅读

社区团队 FINAL-Bench 在 Hugging Face 发布了 POCKET-35B-GGUF 系列的量化模型,主打「无 GPU 也能跑 35B」的本地推理路线,原生兼容 llama.cpp,无需 CUDA、无需云端。Reddit r/LocalLLaMA 上的发布帖宣称在 CPU 上可达到 59 tokens/s 的生成速度。

模型线与适配设备

该系列针对不同硬件档次给出了多档量化,覆盖 PC、mini-PC、Android 手机以及 iPhone/iPad/Mac。核心版本为 POCKET-35B-GGUF,提供 Q4_K_M、Q2_K、IQ1_M 三种量化档位。

  • POCKET-35B-GGUF Q4_K_M:文件 21 GB,需 32 GB 内存的 PC 或服务器,主打最佳质量。
  • POCKET-35B-GGUF Q2_K:⭐ 推荐档,文件 13 GB,可跑在无 GPU 的 mini-PC 上作为「日常主力」。
  • POCKET-35B-GGUF IQ1_M:文件 8.2 GB,面向 16 GB 内存设备,强调最小体积下保留完整模型结构。

韩语与英语分支

在 35B 主线之外,作者还针对不同语言与平台推出了轻量分支。

  • POCKET-KR-GGUF IQ2_M:5.1 GB,面向 Android 8 GB+ 内存的韩语手机用户。
  • POCKET-KR-MLX 2-bit:5.1 GB,针对 iPhone/iPad/Mac 的 Apple Silicon 原生 MLX 路径。
  • POCKET-EN-GGUF iPhone-mix:5.3 GB,配合 PocketPal 在 iPhone 上运行的英语版本。
  • POCKET-EN-GGUF PC-mix:6.8 GB,PC 与 Android 通用的英语版本。

质量参考数据

原文以韩语 PPL(perplexity,越低越好)作为参考指标,公开的数值如下:

  • Q4_K_M:5.79(最高质量档)。
  • Q2_K:6.49(推荐档)。
  • IQ1_M:9.69(最小体积档)。
  • POCKET-KR IQ2_M / MLX 2-bit:7.95。

需要注意的是,更激进的量化(IQ1_M)会带来明显的 PPL 上升;英语版本未公布 PPL 数据。

实际意义与局限

POCKET-35B 走的是「在消费级硬件上跑得起」路线,对没有独立显卡的轻量设备用户有一定吸引力。Q2_K 档 13 GB 的体积与 6.49 的 PPL 折中较好,但 IQ1_M 档在 8.2 GB 体积下的 PPL 已升至 9.69,质量损失明显。当前发布以社区仓库为主,原始模型来源、技术细节与 token/s 性能的测试条件并未在帖中充分披露,建议读者参考 Hugging Face 页面获取完整信息后再做选择。

信源