工具
Qwen3.x 27B 在 Strix Halo 上实测:MTP 推测解码接近满命中率
用户在 ROG Flow Z13 上以 Q8 量化运行 Qwen3.8-27B,MTP 推测解码接受率 97–99%,速…
2026.08.17 · 周一约 2 分钟阅读
近日有 Reddit 用户在 r/LocalLLaMA 板块分享了一组本地推理实测:在搭载 Ryzen AI Max+ 395(Strix Halo)APU、128 GB 统一内存的 ROG Flow Z13 上,以 Q8_0 量化运行 Qwen3.8-27B(27B 参数),获得了较为可观的速度与上下文表现。该用户表示,自己此前测试过多个模型,只有这一款能完整生成所要求的单页 HTML 飞行模拟器。
硬件与软件栈
测试平台为华硕 ROG Flow Z13,核心配置如下:
- APU:AMD Ryzen AI Max+ 395(Strix Halo)
- 统一内存:128 GB,分配为 64 GB VRAM + 64 GB 系统 RAM
- 推理后端:Lemonade Server + llama.cpp ROCm 后端
- 量化方案:模型本体 Q8_0,KV Cache 同样使用 Q8
- 解码策略:原生 MTP(Multi-Token Prediction)推测解码
- 上下文长度:约 142k
性能表现
根据发帖者描述,主要性能数据为:
- 生成速度:约 9–19 tok/s,随智能体步骤波动;多数生成阶段可稳定在 16–19 tok/s
- MTP 推测接受率:97–99%,几乎接近满命中
- 完整任务耗时:约 20 分钟完成一个单页 HTML 飞行模拟器的生成
该任务由智能体调用 file/bash 工具链式完成,而非单次对话式输出,因此速度随工具调用与文件写入节奏波动较大。
参考与局限
需要说明的是,原文标题中的「Qwen3.8」并非通义千问已知的公开版本号,疑似发帖者笔误,实际所指应为 Qwen3 系列 27B 规模的某一变体;本文按原文如实转述,模型具体身份仍待官方核实。此外,本次测试仅为单一硬件平台的个人体验,缺乏横向对比与多次复现数据,结论不宜直接外推至其他平台或模型版本。对希望在 Strix Halo 平台上尝试长上下文本地推理的开发者而言,这组数字可作为一个参考起点。
