桃子桃子快讯
返回首页
开源

社区发布文生图评测基准,覆盖 52 个模型超 9000 张图

研究者设计 192 道高难度提示词,对 52 个文生图模型进行系统评测,并公开全部图像、数据集与代码。

2026.08.27 · 周四2 分钟阅读

一名社区研究者近日发布了一个面向文生图(Text-to-Image, T2I)模型的开放式评测基准 ImageBench,覆盖 52 个当前主流 T2I 模型,累计生成并分析超过 9000 张图片。与多数公开排行榜只提供分数不同,该项目同步公开了全部生成图像,便于研究者直观对比模型表现。

基准设计思路

作者精心整理了 192 条高难度提示词,覆盖多个对 T2I 模型具有挑战性的维度:

  • 文字渲染:要求模型在图像中正确呈现指定文字。
  • 空间关系推理:测试模型对「左」「右」「上」「下」等位置关系的理解。
  • 人物真实感:考察生成人物在姿态、表情、光照上的自然程度。
  • 否定语义:检验模型是否真正理解「no」「without」等否定词的含义。

每条提示词都附带一个二元判断问题及其标准答案,再由一个视觉语言模型(VLM)作为「裁判」,对每个模型的输出进行打分。

资源开放情况

该项目以「完全开放」为核心理念,提供了完整的复现链:

  • 测评方法说明:详细介绍了提示词选择、评判标准与流程。
  • Hugging Face 数据集:包含所有提示词以及对应模型的生成结果,可用于二次分析。
  • GitHub 代码仓库:支持研究者复现或扩展评测。
  • 图库与排行榜:以网页形式呈现每个模型在各维度上的可视化对比。

局限与适用场景

作者在原帖中也坦诚指出了当前基准的两点局限:一是评测范围仅限于文生图任务,未覆盖文生视频、图像编辑等场景;二是以 VLM 作为评判手段本身并不完美,自动化打分与人类主观感受之间仍可能存在偏差。

尽管如此,对于希望横向对比不同 T2I 模型短板的研究者与开发者而言,这一数据集提供了一个低门槛、可复现的起点,后续也可在此基础上补充人类评估或多模态裁判来进一步提升评测质量。

信源