桃子桃子快讯
返回首页
开源

TensorSharp 开源 LLM 推理引擎亮相,自称对 llama.cpp 不落下风

开发者推出开源本地推理引擎 TensorSharp,支持多模型与多 GPU 后端,公布与 llama.cpp 的同后端基…

2026.07.26 · 周日4 分钟阅读

近日,开发者 /u/fuzhongkai 在 Reddit r/LocalLLaMA 板块发布了一款名为 TensorSharp 的开源本地大语言模型推理引擎,并公开了与 llama.cpp 的基准对比结果。该项目兼容 OpenAI 与 Ollama 接口,可运行于 Windows、macOS 与 Linux 系统,支持 NVIDIA(CUDA)、Apple(Metal)、AMD 与 Intel(Vulkan)等多种 GPU 后端。

项目定位与实现

TensorSharp 宣称并非 llama.cpp 的 C# 包装,而是从底层到顶层完整实现的 LLM 推理引擎。CPU 后端下为纯 C# 代码执行;GPU 侧则实现了 CUDA、MLX 与 GGML 后端,其中 GGML 以外部依赖方式引入,并在此之上构建了若干算子融合。设计上吸收了多个开源项目的成熟方案:

  • paged KV cache 与连续批处理借鉴自 vLLM
  • 面向 MoE 模型的 SSD 缓存借鉴自 oMLX
  • GGUF 量化格式与部分 prefill / decode 优化继承自 llama.cpp

模型与能力覆盖

当前 TensorSharp 支持多种 Unsloth 系列 GGUF 量化模型,涵盖 Gemma 4 E4B it(密集多模态,Q8_0)、Gemma 4 12B it(QAT UD-Q4_K_XL,密集)、Qwen 3.6 35B-A3B(UD-IQ2_XXS,MoE)与 Qwen 3.6 27B(UD-IQ2_XXS,密集)。能力上覆盖多模态(图像、视觉、音频)、推理、函数调用与 Qwen Image Edit 等任务。

与 llama.cpp 的同后端基准对比

开发者公布的几何平均结果(single-stream,MTP-off;>1.0× 表示 TensorSharp 更快或首 token 时延更低)如下:

  • Gemma 4 E4B it:CUDA 后端 decode 1.02×、prefill 1.28×、TTFT 1.27×;Vulkan 后端分别为 1.00×、1.05×、1.03×
  • Gemma 4 12B it:CUDA 后端 1.04×、1.17×、1.16×;Vulkan 后端 1.21×、1.04×、1.03×
  • Qwen 3.6 35B-A3B:CUDA 后端 0.98×、1.28×、1.27×;Vulkan 后端 0.87×、1.04×、1.03×
  • Qwen 3.6 27B:CUDA 后端 1.07×、0.96×、0.95×;Vulkan 后端 1.02×、0.85×、0.84×

总体来看,TensorSharp 在 CUDA 后端的 prefill 与首 token 时延(TTFT)上对 llama.cpp 有小幅领先(多数场景落在 1.16–1.28× 区间),decode 吞吐在不同模型与后端上互有胜负;Vulkan 后端下,Qwen 3.6 系列场景略低于 llama.cpp。

社区反馈邀请

项目以开源形式发布,开发者邀请社区提供反馈与代码审查,并在帖子末尾呼吁在 GitHub 上给予 Star 支持。需要指出的是,上述全部基准数据均由开发者自行测试与整理,目前尚未见到独立第三方对 TensorSharp 进行复现或更广泛的对照评测。

信源