骑自行车的鹈鹕:1008 张图实测 AI 实验室是否在刷榜
作者用 8 种动物 × 6 种交通工具生成 1008 张 SVG 图,测试 7 家前沿模型,发现鹈鹕骑车表现并非异常,未…
Simon Willison 多年坚持用同一句提示词测试各家大模型:「画一只骑自行车的鹈鹕」。这句看似戏谑的请求,逐渐成为 AI 圈最知名的非正式基准之一,相关评测结果经常出现在新模型发布帖的热评里。当模型发布涉及数十亿乃至上万亿美元的商业利益时,外界难免怀疑:会不会有实验室专门针对这道题「刷榜」(benchmaxxing)?一篇发表在个人博客上的实验文章给出了否定答案。
实验设计:48 种动物-交通工具组合 × 7 家模型
作者并未只测鹈鹕骑自行车这一格,而是搭建了一张「动物 × 交通工具」组合表:动物包含鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫共 8 种;交通工具包含自行车、独轮车、滑板、踏板车、飞机、船共 6 种。两两组合共 48 个提示词,原版「鹈鹕骑自行车」只是其中之一。作者解释,选择时兼顾了与原题相似度和难度梯度——火烈鸟、苍鹭与鹈鹕形态相近;猫、浣熊、水獭属于简单题;羚鲸较难。
被测模型涵盖 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro 共 7 款前沿模型,统一通过 OpenRouter 调用,每个提示词采样 3 次、温度 1.0、推理力度相同,最终获得 1008 张 SVG。
评分流程分三步:
- 渲染:将 SVG 转为 PNG,若失败则重新生成并记录重试次数,全过程仅 11 次重试。
- 打分:由 GPT-5.6 Luna 对「动物形态」「交通工具形态」「动作连贯性」三项各打 1–5 分,平均分作为综合 judge 分数。
- 特征提取:再让 Gemini 3.1 Flash-Lite 识别图像中的动物、车辆、朝向及场景元素,用于辅助分析。
证据一:鹈鹕骑车的图视觉上并未更好
作者在量化分析前先肉眼浏览了所有图像,认为各模型的「鹈鹕骑自行车」作品并未明显优于其同模型下的其他动物-交通工具组合。GLM-5.2 的第一组采样中鹈鹕骑车略好,但同批还产出了一张相当出色的「苍鹭踩滑板」,因此不能断言。只有这一点主观,作者才转而依赖量化打分。
证据二:鹈鹕在所有动物中排第六
把 7 家模型的动物形态得分取均值后,鹈鹕在 8 种动物中排第 6,落后于猫、鲸鱼、浣熊、苍鹭、羚羊。如果实验室针对这一基准调过训练,鹈鹕理应位列前茅,结果却处于下半区。作者承认这并不能完全排除作弊——鹈鹕本身可能就比猫更难画,即使针对训练,也可能仍打不过「简单题」。
证据三:自行车在所有交通工具中几乎垫底
交通工具维度同样如此:自行车在 6 种车中排倒数第二,仅略好于飞机。背后的原因是自行车需要双轮匹配、车架连接两个轴、把横、座椅、踏板五要素齐全,而 judge 在约 2/3 的自行车图像上都标记了缺失或脱节零件。相比之下,滑板、踏板车、船的 1–2 分率极低甚至为零。
飞机一项作者承认选词欠妥:「plane」容易被模型当作几何平面而非飞行器使用,导致 168 张飞机图中有 25 张完全找不到交通工具,20% 评分在 1–2 分。
证据四:鹈鹕骑车在 48 个组合中排第 42
将动物和交通工具合并为单一组合得分后,「鹈鹕骑自行车」在 48 格中位列第 42,仍处下游。作者提示正文此处中断(原文以「To account for that, I fit…」收尾),但从现有证据看,即便加入难度调整,也未观察到「鹈鹕骑车」显著高于模型自身水平的情况。
结论与启示
基于 1008 张生成图像与三阶段打分,作者的初步结论是:截至目前,没有明显迹象表明主流 AI 实验室在针对 Simon Willison 的「鹈鹕骑自行车」提示词专门调优。这一结果让「LLM 都在作弊刷榜」的猜测暂时缺少实证支撑。
但作者也提示了局限:鹈鹕与自行车本身偏难,即便存在针对性训练,也可能被题目难度抵消;非正式基准天然容易被「反向工程」,一旦基准本身变难或者被弃用,刷榜行为也更难被外部察觉。所有实验代码已在 GitHub 开源,读者可自行复现与扩展。
