桃子桃子快讯
返回首页
工具

3.1 万次小时级 LLM 基准分析:跨日波动约为日内 3 倍

研究者对 49 个模型做持续基准测试,发现日内波动 2.8 分、跨日波动 8.4 分,并据此搭建开源漂移检测系统 AIS…

2026.08.29 · 周六3 分钟阅读

一名开发者在 Reddit r/MachineLearning 发布了一项针对主流 LLM API 的持续基准分析:累计 31,352 条小时级评分、覆盖 49 个模型标识,结果显示日内评分波动约为 2.8 分,而跨日波动高达 8.4 分,后者约为前者的 3 倍。这意味着孤立的每小时波动更多反映模型的随机性,而跨日的持续变化才是判断「性能漂移」的更可靠信号。作者据此构建了开源系统 AIStupidLevel,前端与后端均采用 MIT 协议。

数据与评测流程

该分析围绕一组固定的编程、深度推理、工具调用与高频 canary 任务展开,所有评分归一化为 0–100 的复合分数。

  • 编程类回答会在隔离的 Docker 环境中真正执行,而非仅由另一个模型评判;
  • 工具调用测试要求模型正确选择工具、构造合法参数并完成完整工作流;
  • 每个任务重复执行 5 次并聚合结果,以削弱异常生成的影响;
  • 提示词、评分逻辑与 API 参数在提供商支持的前提下保持一致。

核心结论:跨日波动约为日内 3 倍

作者将小时级评分聚合成每日中位数,并结合序贯变点检测(sequential change-point detection)来识别真实的性能漂移或恢复事件。一个候选事件必须同时满足「持续超出历史方差」与「最小效应阈值」两项门槛,才会被判定为降级或恢复。这一设计减少了把随机噪声误判为模型故障的风险。

持续监控系统的现状

AIStupidLevel 的完整数据集已扩展到 169,858 次基准运行、104,458 条有效评分、累计处理 8,800 万以上 token,历史共记录 81 个模型标识,当前持续监控 22 个模型、接入 6 家服务商。监控面板将模型分类为「稳定、波动、降级、恢复中」,并分别展示编程、推理、工具使用、可靠性、延迟与价格六类指标。

一个真实案例:Gemini 3.1 Flash Lite

在最近一次截图中,系统检测到 Gemini 3.1 Flash Lite 出现 32% 的持续性能下滑,并将其标记为「严重事件」。此外,该数据集还驱动一个 OpenAI 兼容的路由器,按模型在特定任务上的当前表现、稳定性、工具调用可靠性、延迟与成本进行动态选型,为生产环境补齐「模型能力是否仍然达标」这一被现有监控普遍忽略的可观测维度。

项目地址:

信源