研究论文
研究显示 AI 辅导 GRE 学习效果与人类教师相当,成本低 918 倍
基于 2383 名参与者的实验表明,AI 辅导在 GRE 学习增益上与人类专家辅导统计等效,单项最佳 AI 辅导在 7…
2026.09.25 · 周五约 3 分钟阅读
一项发表在 arXiv 上的研究提出 AI 教学评测基准 StudentBench,并在超过 2,300 名真人参与者中实证比较了 AI 辅导、人类专家辅导与无辅导三种条件下的 GRE 学习效果。结论显示,AI 辅导在整体学习增益上与人类专家辅导「统计等效」,同时成本差距悬殊,对 AI 教育落地具有参考意义。
研究规模与实验设计
作者搭建了 StudentBench 评测套件与配套数据收集平台,累计记录了超过 17.5 万条学生与 AI 之间的对话消息。研究共招募 2,383 名真人参与者,分别接受 AI 辅导、人类专家辅导或不接受任何辅导,并对其在 GRE 定量推理(Quantitative)与文字推理(Verbal)题目上的学习增益进行测量。
核心结论:等效甚至局部超越
主要结果包含以下几点:
- AI 辅导在 GRE 学习增益上与人类专家辅导统计等效(p = .015)。
- 在 GRE 的 7 个细分领域中,有 5 个领域的最佳 AI 辅导平均表现超过人类辅导。
- 其中一款 AI 辅导在另一项对比中达到与人类辅导等效的学习效果(p = .044),而每提升 1 个百分点的成本仅为 0.0052 美元,人类辅导对应成本为 4.81 美元,差距约 918 倍。
第二项研究:教案与习题质量评估
研究还组织了人类专家教师对 LLM 生成的教案与练习题进行成对评分,共获得 2,028 次评分。两项研究合并后,从以下五个维度对 AI 辅导进行系统区分:
- 课程规划(lesson planning)
- 练习题生成(practice-problem creation)
- 对话式教学(conversational pedagogy)
- 成本(cost)
- 学生参与度(engagement)
反应速度与学习增益的相关性
在 GRE 定量推理会话中,研究还观察到一组显著的链式相关:AI 回复越快 → 学生发送的消息越多 → 包含正确练习的消息越多 → 学习增益越大(各环节 p < .002)。这一结果为「低延迟交互」在 AI 辅导中的价值提供了量化证据。
资源与可复现性
论文共 47 页,包含正文、参考文献与附录;项目主页与代码仓库已公开(GitHub 可获取),作者为 Curtis Northcutt,论文编号为 arXiv:2609.28470 [cs.AI]。研究者表示,StudentBench 平台可免费使用,旨在推动 AI 教学效果的大规模、可复现实证研究。
