模型发布
智谱称新模型接近 Claude Opus 4.8
智谱称新模型全面胜过 GLM-5.2,并接近 Claude Opus 4.8。
2026.08.26 · 周三约 2 分钟阅读
智谱 Z.ai 在 X 平台发布消息称,GLM-5.3-Flash 在 Code Bench 编程基准测试中表现突出。按照智谱的说法,该模型在所有 effort level 设置下均优于 GLM-5.2,并与 Claude Opus 4.8 处于相近水平。
官方测试结论
- 相对前代模型:智谱称 GLM-5.3-Flash 在所有 effort level 下都胜过 GLM-5.2。
- 相对 Claude Opus 4.8:智谱称两者表现大致相当,但没有公布具体分差。
- 基准用途:Code Bench 在帖子中被描述为衡量真实编程表现的测试基准。
尚缺关键信息
原帖没有披露 Code Bench 的数据集、任务类型、评分标准、测试次数和运行环境,也未说明各 effort level 的具体取值。除此之外,智谱尚未提供 GLM-5.3-Flash 的详细得分、领先幅度、推理成本或完整评测页面。
结论仍待验证
仅根据这条官方消息,目前可以确认智谱对三项比较结果作出了明确表述,但不能独立判断 GLM-5.3-Flash 与 Claude Opus 4.8 是否在各类编程任务上真正等价。后续仍需结合基准说明、完整成绩和可复现实验,并比较响应速度、使用成本与任务稳定性,才能形成更可靠的结论。因此,这项结果目前更适合作为厂商自报评测,而非已经完成独立验证的行业基准。
