研究论文
ASCIITermDraw-Bench 发布 专测大模型 ASCII 绘图能力
Reddit 用户发布新基准 ASCIITermDraw-Bench,含 80 道任务,用于评估视觉语言模型纯文本绘图与…
2026.07.20 · 周一约 2 分钟阅读
一项名为 ASCIITermDraw-Bench 的新基准测试在 Reddit r/MachineLearning 板块发布,专注于评估视觉语言模型(VLM)在纯文本条件下绘制与编辑 ASCII 图的能力。
什么是 ASCIITermDraw-Bench
该基准的出发点是:在向 AI 助手描述架构、拓扑、集群节点关系等概念时,是否可以用纯 ASCII 图替代图像生成?提交者认为,ASCII 图表达结构清晰、易于传播,而让模型在纯文本中精准生成并编辑这样的图,本身就是一项被忽视的挑战。
与多数已有基准集中在代码、数学、推理方向不同,ASCIITermDraw-Bench 把关注点放在一个此前较少被系统评测的能力上:模型能否仅凭文本生成结构准确、布局合理的 ASCII 图,并按指令修改既有图。
任务构成与评分方式
基准共包含 80 个任务,分布在四个方向:
- 基础方框与布局
- 网络拓扑
- 软件架构图
- 基于图像条件的图编辑——要求模型在保留其余内容的前提下修改一张给定的图
每道题输出会得到两个分数:结构分(核查必需的标签、连边、实体与关系是否齐全)和语义分(由一个大模型评审器对每题评估 5 次以降低评判波动)。最终分数在全部 80 题上聚合,并以 95% 置信区间给出结果,弱化了单纯「看起来对」造成的误差。
提交者公开的排行榜
原帖附带的初步排行榜(百分制)如下:
- Gemma-4-31B-IT:73.8%(±4.1)
- Qwen3.7-Plus:70.2%(±4.6)
- Kimi-K2.6:61.8%(±6.0)
- MiniMax-M3:59.5%(±6.3)
- Qwen3.5-9B:47.0%(±6.4)
- Ternary-Bonsai-27B:45.9%(±7.1)
需要指出的是,这一榜单来自 Reddit 用户提交的内容,并未附独立权威渠道核验;榜单中部分模型名称在主流模型目录中并不易直接对应,数字本身仍待更多独立验证。
资源获取方式
提交者表示,12 道示例题与完整方法说明已在 Hugging Face 公开(原文未给出具体链接),研究者可以查看任务格式、审查评测流程,并自行复现测评。
