模型发布
GLM 5.2 视觉版现身 Hugging Face
推理服务商 Baseten 将 Kimi k2.6 视觉编码器合并到 GLM 5.2,补齐原版缺失的多模态能力,并以 N…
2026.07.30 · 周四约 2 分钟阅读
推理服务商 Baseten 在 Hugging Face 上线了一个社区关注的模型:GLM 5.2 视觉版(NVFP4 量化)。该版本由 Baseten 自行合并,将 Moonshot 旗下 Kimi k2.6 的视觉编码器移植到智谱 GLM 5.2 上,补齐了 GLM 5.2 发布时缺失的多模态理解能力,并以 NVFP4 格式开源发布。
合并思路与背景
GLM 5.2 发布时仅支持纯文本输入,社区对其「没有视觉能力」的反馈较多。Baseten(同时也是 OpenRouter 上的推理服务商)选择将 Kimi k2.6 的视觉编码器直接嫁接到 GLM 5.2,从而让原模型具备图文输入能力。这种「文本基座 + 外挂视觉编码器」的合并方式在开源社区较为常见,无需重新训练基座即可扩展多模态能力。
部署与量化
- 模型名称:baseten/GLM-5.2-Vision-NVFP4
- 发布平台:Hugging Face
- 量化格式:NVFP4(针对 NVIDIA GPU 优化的 4 位浮点格式)
- 提供方:Baseten(非智谱官方)
NVFP4 量化有助于在显存受限的推理环境中降低部署成本,但也会带来一定的精度损失。
注意事项
该模型并非智谱或 Moonshot 官方发布,而是由 Baseten 自行合并并托管的第三方版本,效果与官方模型存在差异,建议在生产环境中使用前自行评测。由于原帖未提供 benchmark 数据或能力对比,目前尚无法量化评估视觉合并后的实际表现。
