桃子桃子快讯
返回首页
行业动态

M5 Max 本地大模型跑分:消费级硬件逼近前沿 API

博主用 2026 款 M5 Max 128GB MacBook 测试 6 款本地大模型,最佳者 93% 通过率,仅落后…

2026.08.13 · 周四4 分钟阅读

一位开发者在 2026 款 MacBook Pro M5 Max(128 GB 统一内存)上系统测试了 6 款可在本地运行的大模型,并与 Claude Opus 5、GPT-5.6 Sol 两款前沿云端模型做同题对比。测试涵盖 22 道题、6 类任务(5 道 DuckDB SQL、4 道 agentic pytest 修 bug、4 道 JSON 抽取、4 道输出预测、3 道快速事实、2 道长文档查找),每道题重复 6 次,总计 132 次运行。结论是:最佳本地模型的通过率已达到 92–93%,与前沿 API 的 94–95% 几乎持平,但速度仍明显落后。

测试硬件与模型选择

博主的 M5 Max 配备 128 GB 统一内存,相较此前在 16 GB M1 Pro 上只能跑 3–7 GB 小模型的测试,本次可加载更大体量的本地模型。最终入选的 6 款模型分别为:

  • Muse Glimmer 30B(Meta,MLX 量化版,21 GB,128K 上下文)
  • gpt-oss 120B(OpenAI,MoE,65 GB,128K)
  • Qwen3-Coder 30B(阿里 Qwen,MoE,18 GB,256K)
  • Qwen3.5 35B(阿里 Qwen,MLX 版,21 GB,256K)
  • GLM-4.7-Flash(Z.ai,30B,19 GB,约 200K)
  • DeepSeek V4 Flash 304B(经 antirez/ds4 项目 2-bit 量化,87 GB,原生 1M、运行 32K)

除 DeepSeek 通过 antirez 的 ds4 服务运行外,其余均通过 Ollama 加载,统一使用 pi 编码智能体框架执行同一套测试。

准确率与速度结果

按 132 次运行的总通过率排序:

  • GPT-5.6 Sol(API):126/132 · 95%
  • Claude Opus 5(API):124/132 · 94%
  • Muse Glimmer 30B:123/132 · 93%
  • gpt-oss 120B:122/132 · 92%
  • DeepSeek V4 Flash 304B:122/132 · 92%
  • Qwen3.5 35B:118/132 · 89%
  • Qwen3-Coder 30B:114/132 · 86%
  • GLM-4.7-Flash:99/132 · 75%

云端模型不仅更准,速度也更快;尽管存在网络往返,本地模型在总耗时上仍普遍落后。Muse Glimmer 与 gpt-oss 在准确率与速度之间取得较好平衡,其中 Muse Glimmer 最低只需 32 GB 内存即可运行。Qwen3-Coder 因非思考模型,速度最快,但在预测类题型上失误较多。

与此前基准的对比

对比 mamonas.dev 此前在 16 GB M1 Pro 上的测试——当时多款小模型通过率仅 50% 左右——本次更大内存下的本地模型整体表现已显著逼近前沿 API。博主认为,这一趋势意味着在不远的将来,普通笔记本本地运行接近前沿水平的大模型将成为常态,对于关注 token 成本或数据外发的企业与开发者而言,是值得关注的进展。

注意事项

测试由个人在自有硬件上完成,题目集与评分脚本均已开源,但仍属单一环境下的横截面结果。前沿模型的少数失败中,Opus 5 主要因安全策略拒绝了部分「看起来像网络攻击」的重复 prompt;GPT-5.6 Sol 则在一次调用中遇到服务过载。模型名称与硬件均为文中的未来版本号,本地模型的实际可用性需以读者所在时点的官方发布为准。

信源