桃子桃子快讯
返回首页
研究论文

研究者严格测试:AI 实验室是否在「骑自行车的鹈鹕」上做过优化

Dylan Castillo 设计 48×3 组系统测试、覆盖 7 款模型,未发现 AI 实验室针对性优化鹈鹕骑自行车的…

2026.07.23 · 周四2 分钟阅读

Simon Willison 此前提出过一个颇具娱乐性的非科学基准:让 AI 模型画「骑自行车的鹈鹕」,并一度怀疑各大实验室是否在针对这一画面做定向训练(即所谓的 "pelicanmaxxing")。Dylan Castillo 近日发布了一篇深度分析文章,用更严谨的方法回应了这一疑问。

测试设计:48 组提示 × 7 款模型 × 3 次重复

Castillo 的实验矩阵覆盖了 8 种动物 × 6 种载具 = 48 条提示,每条提示在 7 款模型上各跑 3 次。涉及的模型包括 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 及 DeepSeek V4 Pro。他随后用 GPT-5.6 Luna 和 Gemini 3.1 Flash-Lite 作为辅助评判模型,对生成结果进行系统化打分。

在数据呈现上,文章还提供了一个可交互的筛选视图,方便读者按动物、载具或模型组合来对比结果。

核心结论:没有「鹈鹕优化」迹象

Castillo 通过多维度对比得出几条关键发现:

  • 鹈鹕骑自行车的画面质量并不显著高于其他动物与载具的组合;
  • 各实验室在「画鹈鹕」单项上并不比其他动物更出色;
  • 各实验室在「画自行车」单项上也不比其他载具更出色;
  • 即便按难度做调整,鹈鹕+自行车的组合也没有被画得更好;
  • 生成画面并不像被记忆或背板化的产物。

整体而言,鹈鹕并未被画得比其他动物好,自行车也未被画得比其他载具好,没有任何一家实验室在「鹈鹕骑自行车」这一格子上表现出超预期的能力。

唯一接近的例外:GLM-5.2

唯一值得注意的是 GLM-5.2:它在「鹈鹕骑自行车」这一精确格子上的提升幅度最大,其首张生成样本也给作者留下了印象。但作者强调,这一效应幅度较小、统计上不显著,不宜过度解读。

意义与局限

这项研究是 Simon Willison 长期追踪的「鹈鹕基准」第一次有了系统化的多人评测方法。尽管其本质仍是娱乐性基准,但结论能为讨论「模型是否被定向优化以应付特定评测」提供一个参考案例。值得指出的是,研究覆盖的模型数量与提示数量仍有限,结论是否能泛化到所有主流模型,仍有待进一步验证。

信源