桃子桃子快讯
返回首页
工具

Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充

Reddit 用户用双 RTX 5090 + 768GB DDR5 本地实测 Kimi K3,Q2_K 量化下大提示词预…

2026.07.30 · 周四1 分钟阅读

一名 Reddit 用户在 r/LocalLLaMA 板块分享了对 Kimi K3 在自建硬件上的首批本地推理结果。测试平台为 768GB DDR5 内存搭配两块 RTX 5090 显卡,运行基于 llama.cpp 的社区分叉版本,并使用 HuggingFace 上 GrEarl 发布的 Kimi-K3-GGUF(Q2_K 量化权重)。

吞吐表现

在长提示词(big prompt)场景下,模型的预填充速度稳定在 50–70 tokens/s。用户表示实际表现「好于预期」,并指出一个值得注意的现象:解码阶段的 tokens/s 会随时间逐步上升,可能与显存/内存的预热或换页机制有关。

工具与限制

  • 推理框架:llama.cpp 社区分叉(pwilkin/llama.cpp@kimi-k3-text)
  • 模型权重:GrEarl/Kimi-K3-GGUF,Q2_K 量化
  • 测试硬件:2× RTX 5090 + 768GB DDR5
  • 已知问题:llama-bench 在该环境下崩溃,未能输出标准基准数据

由于缺少官方基准和标准化跑分结果,上述数据更适合作为社区层面的初步参考,而非正式的模型性能对比。

信源