桃子桃子快讯
返回首页
工具

Kimi 大模型 GGUF 本地推理实测:速度仅 0.23 tok/s

Reddit 用户在双 RTX 6000 PRO + 512GB 内存工作站上运行 Kimi 系列模型 GGUF 版本,…

2026.07.29 · 周三2 分钟阅读

社区用户在 r/LocalLLaMA 分享了一次在高端工作站上本地运行 Kimi 系列大型模型(帖中称作「Kimi-k3」,对应文件为 k3-00001-of-00033.gguf)的实测结果,采用 llama.cpp 最新提交的 GGUF 转换与推理 PR,整体推理速度仅 0.2–0.4 token/秒。

硬件与软件环境

  • CPU:9965WX PRO,搭配 512 GB DDR5 6400 内存
  • GPU:RTX 6000 PRO 96GB × 2
  • 存储:PCIE Gen 5 NVMe RAID 卡,2× 4TB 9100 Pro RAID 0,顺序读取约 29 GB/s
  • 软件:基于 llama.cpp PR #26185 完成 GGUF 格式转换,并使用同一 PR 启动推理

推理速度测试

作者给定的提示词为一段 C++ 编程题——让模型写一个原地反转链表的函数并解释指针操作。实测结果如下:

  • Prompt eval:40 tokens / 97.5 秒,约 0.41 tok/s
  • 生成 eval:400 tokens / 1769.9 秒,约 0.23 tok/s
  • 合计:440 tokens / 1867 秒,约 31 分钟

启动命令关键参数:开启 CUDA_VISIBLE_DEVICES=0,1,使用 mmap(默认开启),并设置 --n-cpu-moe 93 -ngl 99 -c 8192 -fa on --jinja,其余参数保持默认。

后续计划

作者表示,下一步将把工作站通过 2× 25GbE 网卡接入 100GbE Fabric(含 4 节点 Spark 集群),改用 RPC server 方式扩展推理能力,以缓解单机推理过慢的问题。

参考意义

本次实测展示了 Kimi 系列大模型在消费级高端硬件上的可行性与代价:尽管可通过 GGUF 在多 GPU + 大内存环境下加载运行,但 0.2 tok/s 量级的生成速度距离日常交互仍有较大差距,更适合作为研究验证、模型能力确认或后续集群推理方案探索的中间形态。

信源