桃子桃子快讯
返回首页
工具

M1 Max 本地跑 Qwen3 量化版,一句话生成网页俄罗斯方块

用户在 M1 Max 64GB 上用 llama.cpp 加载 Qwen3 量化权重,约 40K token 一小时内生…

2026.08.16 · 周日3 分钟阅读

近日 r/LocalLLaMA 上一位用户分享了一次本地大模型实测:使用 llama.cpp 在 M1 Max 64GB 笔记本上加载 Qwen3 量化版权重,仅凭一句自然语言指令,便一次性生成了一份可在浏览器中直接运行的俄罗斯方块游戏。

实验设置

用户使用 Unsloth 发布的 GGUF 量化权重(UD-Q8_K_XL),通过 llama.cpp 的 llama-server 加载到 Apple Silicon 设备,运行全程开启最大推理模式,并启用了 MTP(Multi-Token Prediction)投机解码以加速生成。

  • 硬件:M1 Max,64GB 统一内存
  • 推理框架:llama.cpp + opencode
  • 模型:Unsloth Qwen3-27B GGUF(UD-Q8_K_XL 量化)
  • 关键参数:temperature 1.0、top-p 0.95、top-k 20、repeat-penalty 1.0
  • 解码优化:spec-type draft-mtp、spec-draft-n-max 2
  • GPU 卸载:-ngl 99(GPU 层全部加载)

性能表现

整个生成过程约消耗 40K token,历时 1 小时 10 分钟。在 M1 Max 上的实测速度为:

  • 生成速度:约 9.5 t/s
  • 提示词处理速度:约 80–100 t/s

用户尚未尝试改进版的 chat template,也未在 oMLX 等其他推理框架上做对比。

模型的自我测试流程

用户给出的提示词仅一句:「Create a tetris clone for the browser in a single self-contained HTML file.」(用单个自包含的 HTML 文件,创建一个浏览器端的俄罗斯方块克隆。)

模型在生成完 HTML 之后,并没有就此收手,而是自主完成了一轮验证:

  • 先编写测试脚本对游戏进行运行测试
  • 发现若干小 Bug 后自行修复
  • 进一步做模糊测试(Fuzz Test),确认无报错

最终产出的游戏包含音效、暂停、双向旋转、Hold 机制、最高分记录等多项功能。用户评价「比预期更完整、可玩性很高」。

小结

本次实测展示了小参数量化模型在 Apple Silicon 上的可用边界:生成速度虽然只有约 9.5 t/s,但凭借最大推理模式与投机解码,模型仍能在合理时间内完成一个功能完整的网页小游戏。需要注意的是,9.5 t/s 与 80–100 t/s 的提示词处理速度仅为单一硬件、单一量化方案下的实测值,受提示词长度、系统负载与模板选择影响明显,不宜简单外推为该模型在所有 M1 Max 设备上的标准表现。

用户已将生成的 HTML 上传至 pagedrop,并表示愿意进一步分享其他测试结果。

信源