工具
开发者展示浏览器端 LFM 2.5 230M 推理达 1440 tok/s
Reddit 用户发布基于 WebGPU 的浏览器端 LLM 推理后端,RTX 3090 上跑 LFM 2.5 230M…
2026.07.26 · 周日约 3 分钟阅读
一名开发者近日在 Reddit 的 r/LocalLLaMA 板块展示了一套基于 WebGPU 的浏览器端大模型推理方案。据介绍,该方案既可在普通浏览器中运行,也可嵌入 Electron 或 Tauri 构建的桌面应用中,具备良好的可移植性,并同时支持 Nvidia GPU 与 Apple Silicon(Metal)设备。
核心思路:针对硬件深度优化的内核
项目作者并未直接复用现有的浏览器推理框架,而是针对目标硬件分别编写了底层内核:
- Nvidia 路径:内核被激进地融合为多 pass(multi-pass)架构,以充分利用显存带宽并降低调度开销。
- Apple Silicon 路径:由于 Apple GPU 采用 Tile Based Deferred Rendering(TBDR)架构,WebGPU 调用开销相对显著,内核被设计为单一的「超大融合内核」(fused mega-kernel),以尽量减少 pass 切换带来的额外成本。
这套「按设备定制」的思路是该后端能在浏览器中跑出极高吞吐的关键。作者表示,实际内核针对运行设备的硬件特性进行了专门调优。
实测速度:230M 模型在 RTX 3090 上突破 1400 tok/s
作者在演示页面 warp.sipp.sh 中给出了两组硬件的实测数据:
- LFM 2.5 230M
- RTX 3090(WebGPU):1400–1500 tok/s
- M4(WebGPU):400–500 tok/s
- Bonsai 1.7B
- RTX 3090(WebGPU):500–600 tok/s
- M4(WebGPU):100–150 tok/s
其中 RTX 3090 跑 230M 模型时达到约 1440 tok/s 的吞吐,这一数字远高于目前多数浏览器内 LLM 演示的水平,也显示出 WebGPU 在经过底层调优后已具备承载中等规模模型实时推理的潜力。
后续计划
作者透露,该 WebGPU 后端仍处于活跃开发阶段,后续将把相关实现合并进其 Sipp 库,方便其他开发者在浏览器或基于 Web 的桌面容器中复用。这意味着未来可能会出现一个面向本地硬件优化的浏览器推理工具链,而不仅仅是一次性的演示项目。
对于关注端侧推理、隐私本地化部署以及 Web LLM 生态的开发者来说,这一项目提供了一个值得关注的速度基准与技术路径参考。
