桃子桃子快讯
←返回首页
工具

NerfWatch:用每日测试和社区投票追踪 AI 模型是否被「削弱」

开发者推出 NerfWatch 工具,每日对主流 AI 模型跑同一套测试,并收集用户投票,用以判断模型是否被厂商悄悄降级…

2026.09.26 · 周六约 3 分钟阅读

独立开发者 @sergehere 在 Hacker News 上发布了 Show HN 项目 NerfWatch,一个专门用来追踪主流 AI 模型是否被「削弱」(nerf)的轻量监测工具。近年来,GPT、Claude、Gemini 等大模型多次被用户质疑「越用越笨」「越来越懒」,但厂商通常不会公开承认降级,NerfWatch 试图用数据和社区投票回应这一争议。

监测思路:基准分 + 社区投票

NerfWatch 的核心做法非常直接:每天对纳入监控的 AI 模型跑同一套固定测试,并将「今天的表现」与「该模型第一周的表现」做对比。这样做的好处是避免横向比较不同模型之间的能力差异,只回答「这个模型自身是不是变差了」一个问题。

在基准测试分数之外,工具还设置了社区投票入口,邀请真实用户对模型「当下体验是否变差」发表看法。最终结论由两部分共同决定:

  • Benchmark:每日自动跑分结果,给出一个「通过率」指标;
  • Community:用户主观投票的汇总,用来反映体感。

当前状态:数据还很早期

从页面公开信息看,NerfWatch 仍处于非常早期的阶段。所有展示的模型条目都标注「Too soon」「1 run so far」「Too few votes」等字样,意味着基准测试尚只跑过一次、社区投票也未积累到可统计的程度,因此尚未对任何模型给出「确认削弱」或「保持稳定」的最终判定。

  • 页面顶部显示:上一次测试 9 月 25 日,下一次测试 9 月 26 日;
  • 每个模型条目同时显示 Benchmark 分数与 Community 投票数,但样本均不足;
  • 当数据达到一定阈值后,结论状态会从「Too soon」切换为正式判定。

订阅机制:只发「结论变更」邮件

为了让关注者第一时间知道结果,NerfWatch 提供邮件通知功能,但策略比较克制:只有在某模型的判定结果发生变化(例如从「正常」变成「疑似削弱」)时,才会发送一封邮件,不会推送每日跑分报告或营销信息。这一设计降低了信息噪音,也方便长期追踪某一两个特定模型的爱好者。

意义与局限

从行业角度看,NerfWatch 的价值在于把「模型降级」这一长期停留在论坛吐槽层面的担忧,转化为可量化、可比较的数据资产。如果未来能积累足够长的基线和样本,它有可能成为类似「AI 模型健康度仪表盘」的公共基础设施。

但需要注意的是,目前该项目由个人开发者维护,测试题目、评分方法、样本量都尚未公开披露,也未接入 GPT、Claude、Gemini 等厂商的官方评测体系。对于看重严谨 benchmark 的研究者来说,现阶段它更像是一个社区信号源,而非权威评测平台。

信源