桃子桃子快讯
返回首页
工具

Headroom:30 秒测出本地 AI 推理的 GPU 带宽上限

一款基于 WebGPU 的浏览器工具,30 秒测出设备真实显存带宽上限,并检测影响浏览器内 LLM 的 subgroup…

2026.07.20 · 周一3 分钟阅读

开发者「Headroom」上线了一款面向本地 AI 推理场景的浏览器端基准工具:只需约 30 秒,就能测出当前设备在运行本地大模型时能达到的真实显存带宽上限,并据此推算常见模型的 tokens/s 理论天花板。该工具基于 WebGPU 运行,无需下载模型权重、无需注册账号,也不会上传任何遥测数据。

它测的是什么

Headroom 的核心指标是「显存带宽上限」,即在空上下文中读取参数所需的峰值字节吞吐。本地大模型推理受制于「读权重」速度:模型每生成一个 token,都要把全部(或活跃部分)参数从显存搬到计算单元,因此带宽决定了 tokens/s 的物理上限。

工具通过合成权重(仅拉取约 0.4 MB 的公开张量元数据用于推导 bytes-per-token)来测量真实读取带宽,再据此对若干常见规格给出预测:

  • Gemma 4 e2b class:常驻约 2.46 GB
  • Gemma 4 e2b QAT:常驻约 2.46 GB,PLE 约 1.05 GB/token
  • 8B class Q4:约 4.7 GB 稠密
  • Bonsai 27B 1-bit:约 3.8 GB 稠密

Headroom 强调只统计流式核心(streamed core),剔除已 gather 的 embedding 与未使用的塔,因此 bytes-per-token 在张量清单可推导时是精确值;若推导失败,则退化为保守区间(full-artifact floor → active-core estimate)并明确标注。

测量方法与可重复性

为减少噪声,Headroom 在以下三处做了约束:

  • 在计时前先跑一次 FP64 参考门(reference gate),剔除计算吞吐明显异常的设备。
  • 采用 5 次中位数(med·5),而不是峰值,保证结果稳定。
  • 测量页面附带「Run Receipt」,每行结果都列出 probe、bytes/pass、iterations × reps、gate 等参数,方便复现。

项目方在方法学页面给出了 M1 与 RTX 5070 的对照验证:实际推理引擎通常落在理论上限之下,二者之间的差距即「引擎开销」(engine overhead),这部分开销来自算子融合、KV cache 管理等与硬件无关的损耗。

顺手检查 subgroup bug

Headroom 还内置了一个 subgroup canary,用于检测 GPU 驱动中已知的 subgroup bug——该 bug 会导致部分浏览器内 LLM 静默生成乱码输出。对依赖 WebGPU 在浏览器里跑模型的用户来说,这是一项实用的体检项。

运行环境

  • 浏览器:Chrome / Edge 桌面版,或较新版本的 Android Chrome
  • 要求:必须支持 WebGPU
  • 数据:测量数据默认留在浏览器内,除非用户主动分享

Headroom 并非要取代 llama.cpp、MLC-LLM 等推理引擎的官方 benchmark,而是给本地 AI 玩家提供一块「快速量体温」的尺子:先看到硬件天花板,再去调引擎与量化策略。

信源