桃子桃子快讯
返回首页
工具

Human Benchmark:让人与 AI 同台做推理题

开发者发布小型工具,让人类答题者与 AI 在相同基准上比较推理得分,采用 Rasch 模型估计能力百分比。

2026.07.22 · 周三2 分钟阅读

一位开发者近日在 Hacker News 上发布了一款名为「Human Benchmark」的小型工具,允许人类答题者直接对照 AI 模型在同一推理题集上的得分表现,直观感受自身与主流大模型在常识、数学与逻辑推理任务上的差距。该项目以「Show HN」形式发布,属于个人性质的概念验证作品。

题库来源

工具内置的题目均来自学术界已有的公开基准,覆盖从基础常识到高阶推理的多类任务:

  • CommonsenseQA:日常生活常识题,对多数人类而言较为简单。
  • GSM8K:小学阶段的应用题与算术推理。
  • AGIEval LSAT 子集:法学院入学考试的逻辑推理真题,要求识别论证缺陷或隐含前提。
  • AGIEval AQuA-RAT:GMAT 与 GRE 风格的定量推理题。
  • BIG-Bench Hard:包含逻辑演绎、对象计数、日期运算、动态追踪、因果判断与真话者谜题等子类。

计分方法与误差区间

工具采用 Rasch 模型——一种经典的心理测量学项目反应模型——从相对少量的作答中估计出能力百分比得分。每次作答后,系统会刷新一条 95% 置信区间带:该区间初期较宽,随着作答数量增加而逐渐收窄。若两位答题者(或人与 AI 模型)的置信带大幅重叠,则其在统计意义上的差距并不显著,需更多作答才能区分。

定位与局限

作者在介绍中明确指出,这只是一个「概念验证」(proof of concept),目的是用人类场景演示大模型基准测试的工作原理,并非严肃的智力或推理能力测评,心理测量学效度有限。因此,该工具更适合作为趣味对照或科普演示,而不宜用于科研、能力鉴定或人事评估等正式场景。

信源