工具
百元级单板机纯 CPU 跑 0.6B 至 8B 模型实测
在搭载 Celeron N5095、售价约 100–130 美元的单板电脑上用 Ollama 测试 6 款模型,结果显示…
2026.07.24 · 周五约 3 分钟阅读
近日,Reddit 用户 tre7744 在 r/LocalLLaMA 发布了一组低预算硬件实测:在搭载 Intel Celeron N5095(4C/4T、TDP 15W)的 Youyeetoo X1S 单板机上,使用 Ollama 以纯 CPU 模式跑 6 款参数量从 0.6B 到 8B 的模型,并记录了 tokens/s、温度与稳定性数据。原帖已附上完整脚本、原始日志与结果表格。
测试平台
- 硬件:Youyeetoo X1S 单板机,CPU 为 Celeron N5095(Jasper Lake,4 核 4 线程,TDP 15W)。
- 内存与存储:16 GB RAM + 128 GB NVMe。
- 系统:Kali Linux 2025.4。
- 整机裸板价:约 100–130 美元(视内存与存储配置)。
- 软件:Ollama(CPU 后端)。作者表示 Ollama 自动识别到了 Jasper Lake 的 iGPU,但选择了 CPU 推理,因此本次所有结果均为纯 CPU 输出。
关键结果
- Qwen3 0.6B:平均 6.788 tokens/s,作者认为可以交互式使用。
- 8B 模型:可装入 16 GB 内存并启动运行,但平均仅 0.924 tokens/s,实际不可用。
- 介于两者之间的 4 款模型的详细成绩见作者仓库中的完整表格。
- 压力测试:15 分钟全核满载平均温度 74.66°C,峰值 77°C,原装散热下未出现降频。
解读与后续计划
- 作者指出,在 TDP 低于 15W 的 x86 平台上,小模型的实际可用性「比预期更好」。约 7 tokens/s 的速度足以承载分类、路由、摘要等通常会被外包给 API 的后台任务。
- 关于 8B 模型不可用的现象,作者给出的判断是「瓶颈在内存带宽而非容量」:模型能加载并运行,只是要等很久。
- 作者计划下一步在同一颗 Jasper Lake 芯片上用 llama.cpp + Vulkan 调用 iGPU 进行推理,并与本次的 CPU 结果做对比。
局限与披露
- 本次测试仅覆盖一台设备、一款 CPU 与单一软件栈,未做横向对比或 GPU 加速测试,存在样本单一的局限。
- 作者已在文末披露:测评所用的单板机由 Youyeetoo 提供,但测试方法与结论均为个人独立完成。
- 脚本、原始日志与完整结果:https://github.com/TrevTron/youyeetoo-x1s-kali ;博客原文:https://www.unland.dev/blog/budget-cyberdeck-youyeetoo-x1s-kali 。
- 作者仍在征集 N100、N150 或 Jasper Lake/Alder Lake-N iGPU 的 Vulkan 推理数据,以便后续做横评。
