四项独立指标交叉印证:AI 能力「曲棍球杆」拐点出现
四种不同方法测得的指标都在 2025 年末同步抬头,25 天内四大旗舰模型相继发布,AI 能力跃升并非单一基准的伪信号。
2025 年最后六周,xAI、Google、Anthropic、OpenAI 四家头部实验室在 25 天内相继推出旗舰模型——Grok 4.1(11 月 17 日)、Gemini 3(11 月 18 日)、Claude Opus 4.5(11 月 24 日)、GPT-5.2(12 月 11 日)。伴随这次密集发布的,是四项彼此独立的能力指标几乎同步出现的「曲棍球杆」式拐点。
为什么需要多项指标交叉印证
任何单一基准曲线都容易被质疑:测试数据可能泄漏到训练集(污染)、题目过易导致所有人触顶(饱和)、或者评分机制被「刷分」而模型能力并未实质提升。作者援引气候科学中的「曲棍球杆」争论指出,正是多种独立方法——树轮、冰芯、钻孔温度、珊瑚记录——指向同一方向,才让温度趋势不再被当作测量伪迹。同样的「多代理检验」(multiproxy test)也被用于评估当前的大模型进展。
四项独立指标在 2025 年末同步抬头
四项指标分别由不同机构、用不同方法测量,涵盖任务执行、流体推理、认知能力与专家级知识四个维度,全部在 2025 年末前后出现显著跃升:
- METR 时间跨度:衡量前沿模型有一半概率能独立完成的最长软件工程任务时长。Claude 3 Opus 于 2024 年 3 月创下 4 分钟纪录;Claude 3.7 Sonnet 在 2025 年 2 月达到约 1 小时;Claude Opus 4.5 在 2025 年 11 月接近 5 小时;Claude Opus 4.6 于 2026 年 2 月突破 12 小时。不到两年,时间跨度放大了约 180 倍。
- TrackingAI 离线认知测试:测试题不公开上网,训练污染风险较低。2024 年 3 月,超过九成人类能跑赢当时最佳 AI 系统(约 1/1.1);到 2026 年 6 月,每 44 名随机人类中才有 1 人能超过 AI 得分。
- Humanity's Last Exam(HLE):跨学科博士级难题。2025 年 5 月得分为 2.7%,2026 年 6 月升至 53%。一篇 OpenReview 论文估算,达到相应分数所需算力呈指数级增长,从 2.7% 到 53% 大约需要 200 倍的算力投入。
- ARC-AGI-2:侧重流体抽象推理而非记忆知识。从 2024 年 5 月到 2025 年 8 月,GPT-4o 与 GPT-5 长期停在 9% 与 9.4%,十五个月几乎横盘;同期 METR 时间跨度却提升了约 29 倍。2025 年 11 月起,Gemini 3 Pro 冲到 31%,Claude Opus 4.5 达到 38%,GPT-5.2 在 12 月达到 53%——六周内从横盘变为陡升。
四项指标叠加后,拐点不再是「恰好同步向上的四条线」,而是任务执行、流体推理、专家认知与抽象推理四类不同能力在同一时间窗口集体跨越阈值。
拐点背后的机制
作者把这种加速归因于相互叠加的几股力量,其中第一条是「预训练效率」。Epoch AI 估算,训练一个模型达到既定能力水平所需的算力,大约每 8 个月减半——与实验室买多少原始算力无关。驱动力来自架构层面的演进,例如混合专家(MoE)模型让每个输入只路由到全部参数中的一小部分即可完成推理,从而用更低计算量换取相当的能力。
四项测量结果、四个时间窗和四家实验室的产品节奏彼此呼应,让「AI 是否真的在进步」从口水之争变成了一个可以用数据回答的问题。
