工具
Apple Silicon 上 LLM 推理速度实测:开源原始基准数据
团队在自家生产机队上用 Ollama 实测 M4 Pro、M4 Max、M3 Ultra 等芯片的多款 LLM 推理速度…
2026.07.28 · 周二约 4 分钟阅读
一份在 Apple Silicon 上对大语言模型(LLM)推理速度进行实测的公开基准近日在 Hacker News 上引发关注。与常见的「按规格表估算」不同,该项目明确强调:所有数字均来自自有生产机队的真实测量结果,并通过 Ollama API 调用统一采集,原始数据以 CC BY 4.0 协议公开发布,附带完整的逐次运行记录。
测试方法与运行环境
测试统一使用 Ollama 0.31.2(基于 llama.cpp + Metal)运行在 macOS 15.3.1(Sequoia)上,保持默认设置,每次跑基准前都重新启动进程,以保证环境干净。
- 每个模型先发起一次预热请求(warm-up)并丢弃结果;
- 之后记录 3 次正式运行的中间值与极差(max−min spread);
- 固定提示词为「Write a 300-word explanation of how attention works in transformer models, aimed at a junior developer. Use one concrete analogy.」;
- 参数设置 num_predict=512、temperature=0.7;
- 模型均从 Ollama 官方模型库拉取,默认量化等级为 Q4_K_M(除非另作说明);
- 速度数值直接取自 Ollama 自身计数器:生成速度 = eval_count / eval_duration,提示词处理速度 = prompt_eval_count / prompt_eval_duration。
整台机器在测试期间处于空闲状态,仅运行系统基础守护进程,避免其他负载干扰结果。
覆盖的硬件与更新策略
首批纳入测试的设备来自项目自身的生产机队:
- M4 Pro(Mac mini),内存带宽约 273 GB/s;
- M4 Max(Mac Studio),内存带宽约 546 GB/s;
- M3 Ultra(Mac Studio),内存带宽约 819 GB/s。
在 Apple Silicon 上,生成速度主要由内存带宽决定,因此理论上应随带宽近似线性提升。但项目方表示只发布实际测到的数据,避免「按规格表推算」。后续容量允许时,同一套测试套件将扩展到机队中的其他芯片。
原始数据与开放协议
所有逐次运行记录已整理为 JSON 数据集,按 CC BY 4.0 协议发布,使用时请注明「Macyou Apple Silicon LLM Benchmarks」并附上链接。该项目最后更新时间为 2026 年 7 月 13 日。如对方法论有疑问,可通过公开邮箱反馈。
局限与适用场景
- 数值仅代表单一提示词(512 token 输出)下的中位表现,未覆盖长上下文、多轮对话或不同量化等级;
- 内存带宽决定了不同 Apple Silicon 芯片之间大致可预期的速度差异,但实际表现还受模型实现、量化方案等影响;
- 项目同时提供「与基准机一致的硬件 + OpenAI 兼容 API」的端点服务,按月固定费用、无按 token 计费,对希望复现或集成结果的用户是参考入口。
总体而言,该基准更偏向一份「方法透明、可复现、数据可下载」的本地 LLM 性能参考表,适合在选型 Mac mini / Mac Studio 跑本地模型时作为参考,而非针对前沿模型能力的全面评测。
