桃子桃子快讯
返回首页
工具

Qwen3.x 27B 在 Strix Halo 上实测:MTP 推测解码接近满命中率

用户在 ROG Flow Z13 上以 Q8 量化运行 Qwen3.8-27B,MTP 推测解码接受率 97–99%,速…

2026.08.17 · 周一2 分钟阅读

近日有 Reddit 用户在 r/LocalLLaMA 板块分享了一组本地推理实测:在搭载 Ryzen AI Max+ 395(Strix Halo)APU、128 GB 统一内存的 ROG Flow Z13 上,以 Q8_0 量化运行 Qwen3.8-27B(27B 参数),获得了较为可观的速度与上下文表现。该用户表示,自己此前测试过多个模型,只有这一款能完整生成所要求的单页 HTML 飞行模拟器。

硬件与软件栈

测试平台为华硕 ROG Flow Z13,核心配置如下:

  • APU:AMD Ryzen AI Max+ 395(Strix Halo)
  • 统一内存:128 GB,分配为 64 GB VRAM + 64 GB 系统 RAM
  • 推理后端:Lemonade Server + llama.cpp ROCm 后端
  • 量化方案:模型本体 Q8_0,KV Cache 同样使用 Q8
  • 解码策略:原生 MTP(Multi-Token Prediction)推测解码
  • 上下文长度:约 142k

性能表现

根据发帖者描述,主要性能数据为:

  • 生成速度:约 9–19 tok/s,随智能体步骤波动;多数生成阶段可稳定在 16–19 tok/s
  • MTP 推测接受率:97–99%,几乎接近满命中
  • 完整任务耗时:约 20 分钟完成一个单页 HTML 飞行模拟器的生成

该任务由智能体调用 file/bash 工具链式完成,而非单次对话式输出,因此速度随工具调用与文件写入节奏波动较大。

参考与局限

需要说明的是,原文标题中的「Qwen3.8」并非通义千问已知的公开版本号,疑似发帖者笔误,实际所指应为 Qwen3 系列 27B 规模的某一变体;本文按原文如实转述,模型具体身份仍待官方核实。此外,本次测试仅为单一硬件平台的个人体验,缺乏横向对比与多次复现数据,结论不宜直接外推至其他平台或模型版本。对希望在 Strix Halo 平台上尝试长上下文本地推理的开发者而言,这组数字可作为一个参考起点。

信源