Kimi K3全球首个万亿开源大模型发布
月之暗面发布2.8万亿参数开源大模型Kimi K3,支持100万Token上下文,多项基准超过GPT-5.6,定价搅动海…
7月16日晚9点,距离WAIC(世界人工智能大会)开幕不足24小时,月之暗面(Kimi)正式发布Kimi K3,以2.8万亿参数规模成为全球首款万亿级开源大模型。模型支持100万Token上下文窗口,在多项主流测评中得分超过GPT-5.6、Fable 5,被部分AI一线从业者评价为「在国内断层式领先」。
核心能力与技术架构
Kimi K3的突破依托两大原创架构:KDA混合线性注意力机制(Kimi Delta Attention)与注意力残差架构(Attention Residuals)。前者允许模型在任务关键节点使用全注意力计算以保证精度,在非关键路径切换为线性注意力以降低推理成本。官方数据显示:百万上下文解码速度最高提升6.3倍,训练效率提升约25%,额外成本不到2%。
实测方面,AI研发工程师反馈K3前端生成较GPT-5.6 Sol强约10%–15%,「返工率更低,审美更高」;Web开发场景下代码一次通过率高于OpenAI对应模型。多模态方面,Kimi K3在BrowseComp基准测试以91.2%拿下SOTA。月之暗面将K3定位为服务三类场景:长程编程、端到端知识工作、深度推理。
定价争议与商业取舍
Kimi K3定价处于国产模型最贵一档:未缓存输入20元/百万Token、输出100元/百万Token,约为DeepSeek V4 Pro的20倍、Fable 5价格的30%、GPT-5.6 Sol价格的60%。高盛研报将其定性为「中国模型走向定价权的全新节点」。马斯克在X上为K3点赞,并在预热Grok 4.5时喊话「有望超过Kimi」;月之暗面联合企业业务负责人黄震昕回应:「拭目以待,希望他们跟我们掰一掰手腕。」
高参数也带来沉重算力压力。AI英语训练产品TalkMe创始人贾子健估算,部署DeepSeek V4 Pro需约8张H100或A100,运行K3则需约20张H100;复杂编程任务可能耗时超过30分钟。Kimi在上线不到48小时宣布K3订阅「暂时对新用户关闭」,以保障付费用户体验。黄震昕表示:「公司最终宁可暂时放弃新增收入,也要守住付费客户的使用体验底线。」
资本市场连锁反应
K3发布次日,英伟达、谷歌、Meta、英特尔四家科技巨头股价走低,美媒将其列为当日关键催化剂之一;港股方面,智谱单日下跌28.49%,另一相关港股AI标的下跌15.62%。融资层面,月之暗面计划于8月启动上市前最后一轮融资,目标投前估值约500亿美元(约合3380亿元人民币),最快6个月内登陆港股。
杨植麟的来路与下一步
Kimi创始人杨植麟本硕毕业于清华,在卡内基梅隆大学(CMU)读博期间师从苹果首任AI总监Russ Salakhutdinov。Russ对《中国企业家》评价这位爱徒:「CMU最顶尖的学生之一,既能思考研究问题,又具备很强的技术能力,还能做底层编程——通常这些能力是分开的,很少见到这样能力融合的学生。」杨植麟读博期间参与了XLNet、Transformer-XL等已成为AI模型理论基础的工作,并曾在Google Brain实习。
Russ透露杨植麟曾表达想研究「无限上下文」模型的愿望,「现在上下文大概在100万量级,未来也许他会让模型拥有真正无限长的上下文」。黄震昕则明确表示Kimi的参数规模还会持续向上拓展,「不会止步于2.8万亿——如果行业沿着当前路径继续演进,今天关于价格和Token消耗的所有争论,都只是一个更大故事的开场」。
