模型发布
Nori LLM 宣称推理吞吐突破每秒百万 token
Nori Agentic 发布 Nori LLM,声称推理速度超过 1M tok/s。
2026.09.24 · 周四约 2 分钟阅读
Nori Agentic 在其官网发布了一款名为 Nori LLM 的大语言模型,并宣称该模型在推理阶段可实现超过每秒 100 万 token(1M tok/s)的吞吐速度。这一数字如果属实,将显著高于目前主流大模型在生产环境中的推理表现。然而,目前该消息在 Hacker News 上仅获得 1 个点赞、0 条讨论,社区关注度极低,尚未见到主流媒体或独立第三方对该数据加以验证。
厂商背景与可信度
Nori Agentic 是一家此前在公开渠道曝光较少的厂商,官网为 noriagentic.com,文中未披露团队规模、融资情况或研究背景,也未提供可下载的模型权重、API 接入方式或独立 benchmark 复现脚本。「1M tok/s」作为一项性能声明,其测试硬件(GPU 型号与数量)、batch size、prompt 长度、量化精度等关键条件均需厂商进一步公开,才能与同类模型进行公平比较。
与主流推理吞吐的对比
目前业界已知的高吞吐推理系统多依赖于 vLLM、TensorRT-LLM、SGLang 等专用推理框架,搭配 H100、MI300 等加速卡,在大批量短 prompt 场景下可达到数万至数十万 tok/s 的水平。「超过 1M tok/s」的声明若对应单卡或小规模集群,属于业内领先;若来自大规模分布式推理服务,则需结合总成本与延迟一并评估才有意义。
现状小结
截至目前,Nori LLM 的技术报告、模型卡与开源仓库尚未在主流渠道公布,建议关注其后续是否释放更多细节,包括硬件配置、上下文长度、模型参数规模以及可复现的 benchmark 结果,再对其实际能力做出判断。
