桃子桃子快讯
返回首页
工具

LocalMaxxing:聚焦本地 LLM 推理的社区基准平台

LocalMaxxing 上线社区提交的本地大模型推理基准数据,覆盖速度、首 token 时延与显存占用等指标。

2026.07.23 · 周四2 分钟阅读

LocalMaxxing 是一个面向本地大模型推理的社区基准测试平台,强调「所有数据均来自社区在真实硬件上提交的运行结果,而非厂商自测」。用户可通过其 CLI 工具或网页表单提交测试成绩,平台则会即时把结果更新到公开排行榜上,便于在模型、推理引擎与硬件组合之间做横向对比。

平台核心指标

平台围绕本地推理场景设计,主要采集以下几类指标:

  • tokens/sec:持续生成吞吐量,反映硬件与引擎在稳态下的解码速度。
  • time-to-first-token(首 token 时延):衡量模型加载与首段响应速度,对交互式体验影响明显。
  • VRAM usage:显存占用,决定模型能否在给定显卡上运行以及可用的批处理/上下文大小。

使用流程

平台接入方式相对简洁,主要分三步:

  • 通过 GitHub 登录后在控制台创建 API Key,供 CLI 与自动化代理提交测试结果。
  • 使用官方 CLI 在本地测量上述三项指标,或直接通过网页表单手工提交。
  • 数据提交后即时进入公开排行榜,可按模型、引擎、硬件等维度进行筛选与对比。

配套板块

除基准排行榜外,平台还提供了「Eval scoreboard」(评测分数榜)与「Marketplace」(市场板块),前者用于展示与评测相关的排行数据,后者则聚合了硬件、引擎与周边工具的展示信息,供用户在搭建本地推理环境时参考。

局限与待观察点

需要指出的是,本次可获取的原文以产品介绍页为主,并未披露具体的基准覆盖范围、支持的模型与推理引擎清单,也缺少代表性硬件的对比数据。其结果质量依赖于社区提交的规范性与样本规模,对于希望据此选型的用户而言,仍需结合官方文档与社区口碑交叉验证。

信源