桃子桃子快讯
←返回首页
开源

LogoLabs 开源 260M 参数文生图模型 Agate

Agate 以「thinker 规划 + 渲染器执行」架构,在 GenEval 上取得 0.550,接近 SDXL 的…

2026.09.26 · 周六约 5 分钟阅读

LogoLabs 在 Hacker News 上发布并开源了文生图模型 Agate。这是一个 260M 参数的小型模型,采用「thinker 规划 + 渲染器绘制」的分工架构,在 GenEval 基准上取得 0.550 的官方分数,与 SDXL 公布的 0.55 基本持平,并超过 SD 1.5(0.43)、SD 2.1(0.50)与 PixArt-α(0.48)。整个模型可在一张消费级 GPU 上以不到两秒的速度生成一张图像,并支持 WebGPU 浏览器演示。

模型规模与训练成本

Agate 以 256×256 分辨率输出英文提示图像,参数量按解码器不同有两套口径:

  • 260M(TAESD 解码器):190.9M 生成器 + 68.1M 文本编码器 + 1.2M 解码器;
  • 308.5M(SD-VAE 解码器,默认):在上述基础上将解码器替换为 49.5M 的 SD-VAE-ft-MSE。

训练从零开始,总计 144.7 GH200 小时、墙钟时间不足 13 小时,共见过 146.9M 张图像(约 26 个 epoch)。整个项目(含实验)耗电 176.7 kWh,其中最终模型占 81.8 kWh、对应 2.45 kg CO₂e。训练数据来自 FLUX-Reason-6M 语料中的 5,654,461 张图像,每张最多 8 个英文描述字段。计算资源由 EuroHPC 旗下的 Arrhenius 集群(瑞典 NAISS)提供,硬件为 NVIDIA GH200。

架构设计:thinker 与 renderer 分工

Agate 的核心设计选择是把图像生成拆给两个「专家」:

  • Thinker(思考者):一个小型循环 Transformer,接收完整噪声画布与去噪进度,通过交叉注意力读取最多 512 个文本 token。它理解二维位置关系,能够在 4 次循环后输出一张 16×16 的潜在空间区域规划图。
  • Renderer(渲染器):基于 FCDM 的卷积 U-Net,使用 7×7 卷积核。它不读取文本,只按规划图在 SD-VAE 潜空间上作画,因此保留了较强的图像先验(边缘、纹理、光照),且参数与算力开销可控。

设计假设是:卷积擅长「画」但不擅长「理解句子与空间关系」,Transformer 擅长「规划」但在像素层缺乏先验且开销大。Agate 把规划交给 Transformer 在粗网格上完成,把绘制交给卷积 U-Net。LogoLabs 报告,同等规模与 epoch 下加入 thinker 同时提升了 GenEval 与 Qwen-Image-Bench 并降低了损失;将规划器改为循环、且具备 2D 感知后,位置与颜色绑定能力进一步增强。

基准与速度

在 GenEval(官方评分)上 Agate 为 0.550;在 LogoLabs 自行整理的 Qwen-Image-Bench(1000 条提示)上为 28.2,略低于 SD 1.5 的 29.1,但在同尺寸开源模型的帕累托前沿上。在 RTX 4060 上单图生成约 1.9 秒(50 步),开启 autoguide 后约 2.9 秒。模型还提供 WebGPU 浏览器演示。

强项包括物体空间关系(左侧、上方)、颜色与物体绑定、人脸、风格、扁平 logo 与长提示;弱项集中在精确文字、三以上计数、否定语义以及超过 256 像素的输出,模型声明尚未完全收敛。

使用与开源情况

Agate 代码与权重均以 MIT 协议开源,仓库为 Logolabs/agate-preview-001,并随附技术报告与系统卡。LogoLabs 表示这是「通用基础模型的研究预览版」,尚未针对图标场景做专门微调——该公司主营 AI logo 生成,Agate 是其面向图标生成场景而尝试的更优小模型方案。用户可通过 huggingface_hub 拉取权重并使用 AgatePipeline.from_pretrained 进行推理,主要可调参数包括 seed、steps(默认 50)、cfg(默认 3.0)、negative_prompt(默认空串)、num_images、autoguide、fast_vae(切换 TAESD 解码器以提速)以及 cuda_graphs(默认开启以减少 kernel launch 开销)。

信源