工具
LocalMaxxing:聚焦本地 LLM 推理的社区基准平台
LocalMaxxing 上线社区提交的本地大模型推理基准数据,覆盖速度、首 token 时延与显存占用等指标。
2026.07.23 · 周四约 2 分钟阅读
LocalMaxxing 是一个面向本地大模型推理的社区基准测试平台,强调「所有数据均来自社区在真实硬件上提交的运行结果,而非厂商自测」。用户可通过其 CLI 工具或网页表单提交测试成绩,平台则会即时把结果更新到公开排行榜上,便于在模型、推理引擎与硬件组合之间做横向对比。
平台核心指标
平台围绕本地推理场景设计,主要采集以下几类指标:
- tokens/sec:持续生成吞吐量,反映硬件与引擎在稳态下的解码速度。
- time-to-first-token(首 token 时延):衡量模型加载与首段响应速度,对交互式体验影响明显。
- VRAM usage:显存占用,决定模型能否在给定显卡上运行以及可用的批处理/上下文大小。
使用流程
平台接入方式相对简洁,主要分三步:
- 通过 GitHub 登录后在控制台创建 API Key,供 CLI 与自动化代理提交测试结果。
- 使用官方 CLI 在本地测量上述三项指标,或直接通过网页表单手工提交。
- 数据提交后即时进入公开排行榜,可按模型、引擎、硬件等维度进行筛选与对比。
配套板块
除基准排行榜外,平台还提供了「Eval scoreboard」(评测分数榜)与「Marketplace」(市场板块),前者用于展示与评测相关的排行数据,后者则聚合了硬件、引擎与周边工具的展示信息,供用户在搭建本地推理环境时参考。
局限与待观察点
需要指出的是,本次可获取的原文以产品介绍页为主,并未披露具体的基准覆盖范围、支持的模型与推理引擎清单,也缺少代表性硬件的对比数据。其结果质量依赖于社区提交的规范性与样本规模,对于希望据此选型的用户而言,仍需结合官方文档与社区口碑交叉验证。
