研究论文
o3-mini 在智能体循环中生成高质量考试题
沃顿教授 Mollick 分享研究:用「已被淘汰」的 o3-mini 构建智能体循环生成试题,在大规模实测中达到高利害标…
2026.08.16 · 周日约 2 分钟阅读
AI 生成的考试题目能否达到高利害标准化考试的水平?一项规模较大的现场研究给出了肯定答案。沃顿商学院教授 Ethan Mollick 在 X 上转发了一项基于 OpenAI o3-mini 的实验结果:即便是 Mollick 本人称为「very obsolete(已被淘汰)」的 o3-mini 模型,只要置于智能体循环(agentic loop)中反复迭代,就能够产出高质量的考试题目。
研究核心发现
研究团队在文中写道:「在迄今规模最大的 AI 出题现场研究之一中,我们发现该方法所生成题目在心理测量学(psychometric)特性上,与出现在高利害标准化考试中的题目处于同一水平。」这意味着 AI 不仅能「看起来像」考试题,更在区分度、难度、信度等关键质量指标上逼近人类专家命题水准。
智能体循环的作用
值得注意的是,这项成果并不是单纯由模型一次性生成。研究采用了智能体循环:模型先出题,再用自身或其他工具对题目进行自检、修订与难度评估,迭代多轮后才输出最终版本。这种「出题 + 审题」闭环,是旧版 o3-mini 也能跑出高水平题目的关键。
意义与局限
对于教育测评、题库建设、企业培训等场景,AI 自动出题的可用性向前迈了一大步;但原帖仅给出结论性引文,未披露题量、科目、对照组、心理测量学具体指标(如 Cronbach α、区分度)等细节,也未说明论文或预印本出处,整体信息量偏薄,读者仍需查阅原始研究方可作进一步判断。
