工具
Kimi 大模型 GGUF 本地推理实测:速度仅 0.23 tok/s
Reddit 用户在双 RTX 6000 PRO + 512GB 内存工作站上运行 Kimi 系列模型 GGUF 版本,…
2026.07.29 · 周三约 2 分钟阅读
社区用户在 r/LocalLLaMA 分享了一次在高端工作站上本地运行 Kimi 系列大型模型(帖中称作「Kimi-k3」,对应文件为 k3-00001-of-00033.gguf)的实测结果,采用 llama.cpp 最新提交的 GGUF 转换与推理 PR,整体推理速度仅 0.2–0.4 token/秒。
硬件与软件环境
- CPU:9965WX PRO,搭配 512 GB DDR5 6400 内存
- GPU:RTX 6000 PRO 96GB × 2
- 存储:PCIE Gen 5 NVMe RAID 卡,2× 4TB 9100 Pro RAID 0,顺序读取约 29 GB/s
- 软件:基于 llama.cpp PR #26185 完成 GGUF 格式转换,并使用同一 PR 启动推理
推理速度测试
作者给定的提示词为一段 C++ 编程题——让模型写一个原地反转链表的函数并解释指针操作。实测结果如下:
- Prompt eval:40 tokens / 97.5 秒,约 0.41 tok/s
- 生成 eval:400 tokens / 1769.9 秒,约 0.23 tok/s
- 合计:440 tokens / 1867 秒,约 31 分钟
启动命令关键参数:开启 CUDA_VISIBLE_DEVICES=0,1,使用 mmap(默认开启),并设置 --n-cpu-moe 93 -ngl 99 -c 8192 -fa on --jinja,其余参数保持默认。
后续计划
作者表示,下一步将把工作站通过 2× 25GbE 网卡接入 100GbE Fabric(含 4 节点 Spark 集群),改用 RPC server 方式扩展推理能力,以缓解单机推理过慢的问题。
参考意义
本次实测展示了 Kimi 系列大模型在消费级高端硬件上的可行性与代价:尽管可通过 GGUF 在多 GPU + 大内存环境下加载运行,但 0.2 tok/s 量级的生成速度距离日常交互仍有较大差距,更适合作为研究验证、模型能力确认或后续集群推理方案探索的中间形态。
