Kimi K3 实测:2.8 万亿参数开源模型在 Claude Code 中的表现
作者将 Moonshot 新发布的 2.8 万亿参数开源模型 Kimi K3 接入 Claude Code,实测显示其成…
Moonshot AI 近日公布 Kimi K3 模型,参数规模达到 2.8 万亿,原生支持视觉输入,上下文窗口为 100 万 token,并称这是首个达到该量级的开源模型,权重将于 7 月 27 日发布。值得注意的是,Moonshot 自己在发布文章中坦承 K3 在整体表现上仍落后于 Fable 5 与 GPT-5.6,用户体验也尚未达到同等水平。围绕这款模型的实测与讨论,正在成为观察「开源逼近闭源前沿」这一趋势的重要窗口。
模型概况:超大参数规模的开源旗舰
Kimi K3 拥有 2.8 万亿参数,原生多模态视觉能力与 100 万 token 上下文窗口,是 Moonshot 迄今为止最大规模的开源权重模型。在此之前不久,Thinking Machines Lab 也放出了 9750 亿参数、410 亿激活参数的 Inkling 全权重模型;阿里同期宣布的 Qwen 3.8 同样以超大参数规模走向开源。这意味着超大开源模型的发布已不再是偶发事件,而是形成了一条清晰的产品队列。Moonshot 的发布稿罕见地公开承认 K3 在多项指标上落后于头部闭源模型,这种坦诚也降低了外界对其能力的过高预期。
实测体验:速度偏慢,但可用性尚可
作者长期使用 Claude Code 进行编码工作,已熟悉其节奏与工具链。本次测试通过 OpenRouter 将请求路由到 Kimi K3,整体保留 Claude Code 的使用环境。
- 直观感受:初期明显偏慢,但运行约一小时后逐渐适应,作者表示更多是节奏差异而非真实速度问题。
- 客观数据:Artificial Analysis 测得 K3 输出约 62 token/s,Claude Opus 4.8 为 57 token/s,且 K3 的首 token 时间更短。
- 工具调用:K3 在文件操作、编辑与工具调用上表现稳定,足以让作者忘记后端模型已被替换。
此外,K3 当前在 Code Arena 的前端类任务上排名第一,作者以一个前端复刻任务做视觉验证,认为结果具备一定水准,但仍属特定指令与素材下的单次表现,并不能等同于通用能力。
成本对比:明显低于闭源旗舰
作者给出了完整的 token 与费用明细:
- 请求数:115 次
- Prompt token:1364 万(其中 1295 万命中缓存)
- 输出 token:82307
- 实际花费:7.18 美元
若将同一流量按官方刊价折算,Claude Opus 4.8 约为 11.96 美元,Fable 5 约为 23.92 美元。换算下来,本次 K3 的成本相比 Opus 低约 40%,相比 Fable 低约 70%。作者特别指出,每 token 价格并非完美指标,因为不同模型完成任务所用的 token 数量差异很大。
能力边界:仍非 Opus 级替代品
作者明确表态:在他个人的工作流中,K3 尚不能完全替代 Opus。Opus 在以下场景中仍更可靠:
- 知道何时该停止输出
- 处理含混不清的需求
- 不会自作主张做出用户没有要求的决策
Moonshot 自身也把「过度主动」与「对工具链敏感」列为 K3 的已知短板,与作者的部分体验吻合。作者认为,K3 同样没有达到 Fable 5 的水平,但在 Fable 与 Opus 之下的区间中,K3 已经足够接近,足以让一部分用户优先考虑价格而非边际能力差异。
行业含义:开源正在压缩闭源的溢价空间
围绕 Kimi K3 的讨论呈现出多种相反的声音,包括「中美模型护城河终结」「开源使闭源过时」「开源权重只是营销」等。作者倾向于一个更克制的判断:
- 真正的威胁不在于 K3 拿下第一,而在于它已经好到让「高价」更难被合理化。
- 美国头部实验室的估值依赖于「前沿智能保持稀缺、领先持久、客户愿付高毛利」这一假设;一个贴近前沿、价格更低、易于接入既有软件栈的模型,就足以动摇这一假设。
- 与数据库、操作系统等企业软件不同,API 后的语言模型虽然关键,但替换成本反而较低。
- Epoch AI 的估计显示,最强开源权重模型仅落后闭源前沿几个月;这一时滞足以让买家等待、切换或在多供应商之间分配负载。
- 闭源实验室仍有办法守住溢价,可靠性、工具调用、企业级控制与短期领先都是抓手。
更大的图景是:模型本身正在变得可替换,真正的差异化可能上移到应用层与工作流,下移到芯片、电力与推理基础设施;而「开源」并不等于「运行便宜」,隐私与可控性才是开源权重的核心收益。
