工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
Reddit 用户用双 RTX 5090 + 768GB DDR5 本地实测 Kimi K3,Q2_K 量化下大提示词预…
2026.07.30 · 周四约 1 分钟阅读
一名 Reddit 用户在 r/LocalLLaMA 板块分享了对 Kimi K3 在自建硬件上的首批本地推理结果。测试平台为 768GB DDR5 内存搭配两块 RTX 5090 显卡,运行基于 llama.cpp 的社区分叉版本,并使用 HuggingFace 上 GrEarl 发布的 Kimi-K3-GGUF(Q2_K 量化权重)。
吞吐表现
在长提示词(big prompt)场景下,模型的预填充速度稳定在 50–70 tokens/s。用户表示实际表现「好于预期」,并指出一个值得注意的现象:解码阶段的 tokens/s 会随时间逐步上升,可能与显存/内存的预热或换页机制有关。
工具与限制
- 推理框架:llama.cpp 社区分叉(pwilkin/llama.cpp@kimi-k3-text)
- 模型权重:GrEarl/Kimi-K3-GGUF,Q2_K 量化
- 测试硬件:2× RTX 5090 + 768GB DDR5
- 已知问题:llama-bench 在该环境下崩溃,未能输出标准基准数据
由于缺少官方基准和标准化跑分结果,上述数据更适合作为社区层面的初步参考,而非正式的模型性能对比。
