桃子桃子快讯
返回首页
工具

KTransformers:单卡 RTX 5090 即可本地推理 100B+ 大模型

开源框架 KTransformers 通过 CPU/GPU 异构计算,让单张 32GB 显存的 RTX 5090 也能跑…

2026.07.23 · 周四3 分钟阅读

KTransformers 是一个面向大语言模型的灵活推理框架,核心卖点是利用 CPU 与 GPU 的异构计算,让用户在仅有单张消费级显卡(如 32GB 显存的 RTX 5090)的情况下,也能本地部署 100B+ 参数级别的大模型,并保留全精度推理,无需依赖昂贵的多卡集群。

核心能力

  • 低显存全精度推理:通过 CPU 内存与算力承担部分计算负载,把大体量模型放进单卡消费级 GPU,无需量化即可保持原始模型精度。
  • 低显存全参数微调:同样基于异构思路,在消费级硬件上对 100B+ 模型进行全参数微调,绕开多卡训练集群的成本门槛。
  • 全栈本地工具链:从推理到微调提供一站式部署方案,覆盖本地开发的完整流程。
  • 多模型兼容:官方说明支持 DeepSeek、Kimi、GLM、Qwen、MiniMax 等主流大模型。
  • GPU 推理由 SGLang 提供支持,结合其推理性能优势。

性能表现

官方公布的基准基于 MiniMax-M2.1 FP8 全精度、单 GPU 配置(32K tokens 输入):

  • Prefill 速度:2540 tokens/s(1× RTX 5090 32GB + 2× AMD EPYC 9355)
  • Decode 速度:27.6 tokens/s(同上配置)
  • 相比 llama.cpp(Q8_0 量化)实现约 4.5× Prefill 加速

需要注意的是,框架页面对全参数微调的吞吐量、显存占用以及与全 GPU 训练的对比数据均标注为「Coming soon」,尚未给出实测数字。

适用场景与社区

KTransformers 面向希望在本地或私有环境中运行大模型、又不希望采购多卡 GPU 集群的开发者。其异构计算路线在显存受限的设备上具有较强实用价值。项目方表示已有数千名用户在社区中分享基准、配置与最佳实践,但具体的社区规模、活跃度与维护节奏仍需通过 GitHub 仓库进一步核实。

小结

作为开源推理与微调框架,KTransformers 把「单卡跑百亿级模型」这一目标做了较具体的工程化落地,并给出了初步性能参考。对关注本地部署与低成本算力的开发者而言值得关注,但其相对 llama.cpp 的优势是否能稳定复现、微调基准何时补齐,仍有待后续版本与社区验证。

信源