研究论文
Google 发布 DiffusionGemma 技术报告
Google 公布 DiffusionGemma 技术报告,扩散式 Gemma 变体进入社区视野,llama.cpp 支…
2026.08.11 · 周二约 2 分钟阅读
Google 通过官方渠道发布了名为「DiffusionGemma」的技术报告,相关论文已同步上线 arXiv。这是 Gemma 系列在扩散(diffusion)生成范式方向上的新尝试,与传统自回归逐 token 生成路径形成区分。
发布概况
- 论文标题:DiffusionGemma Technical Report
- arXiv 编号:2608.00146
- 发布渠道:Google Gemma 官方 X 账号(@googlegemma)同步发布
从命名判断,该模型属于 Gemma 家族的扩散式变体,采用迭代去噪方式生成文本,而非主流的自回归从左至右逐 token 路径。扩散式语言模型近期在学术界和开源社区受到关注,与 LLaDA、Mercury 等探索同属一个方向。
本地部署进展
llama.cpp 项目中已有两个相关合并请求(PR 24423 与 PR 24427),目前均停留在 Draft(草稿)状态,尚未进入合并流程。社区用户反馈,希望该 PR 合入后,能在仅有 8GB 显存的消费级显卡上获得更快的 tokens/s 推理速度,从而让 DiffusionGemma 可以在普通硬件上跑起来。
尚待补充的信息
本次披露内容仅包含论文与推文链接,原文摘录中并未提供:
- 模型具体参数规模与训练数据规模
- 与自回归 Gemma 在 benchmark 上的对比数据
- 是否同步发布权重或推理代码
- 与现有扩散 LLM(如 LLaDA、Mercury)的技术差异
如需评估其实际能力与生态影响,仍需等待完整论文内容发布,以及 llama.cpp 等主流推理框架的正式支持。
