研究论文
AI 评估正在侵蚀领导者的独立判断?哈佛新研究引发讨论
哈佛研究人员通过 228 名资深评审的实地实验发现,使用 LLM 辅助评估会显著改变人类的判断决策。
2026.08.20 · 周四约 2 分钟阅读
随着组织越来越多地将 AI 工具用于决策辅助,领导者正在被「训练出」一项原本构成竞争优势的核心能力——独立判断。哈佛商学院旗下《Harvard Business Review》近期刊文,引用了一项由哈佛研究人员开展的实证研究,指出 LLM 介入评估流程后,人类评审的判断准确度与自主性都可能受到系统性影响。
研究背景
文章关注的核心问题是:当人类评审借助 AI 工具给出结论时,AI 是否会让人类的判断力退化?研究人员认为,答案并非简单的「是」或「否」,而是取决于 AI 介入的方式与上下文透明度。这一问题对依赖专家评审的创新竞赛、风险投资、政府项目立项等场景具有普遍意义。
实验设计
为验证上述假设,研究人员设计了一项实地实验,样本来自一项 MIT 全球社会影响创新挑战赛:
- 评审规模:228 名经验丰富的评审人员;
- 待评对象:48 份参赛提交方案;
- 对照基准:4 名与该创新挑战赛相关联的人类专家的判断。
实验将评审随机分配到三种条件之一:
- 纯人工评审:评审仅依靠自身判断,不接触 AI 输出;
- LLM + 叙事说明:评审获得 LLM 给出的评估结论,并附有决策过程的文字解释;
- LLM + 无上下文:评审仅获得 LLM 的结论,没有任何解释或推理过程。
核心命题
文章的核心主张是,AI 提供的「智能」并不等于判断力的增强。当 LLM 的结论缺乏可解释的推理过程时,评审者更容易将其当作权威答案而非参考意见,从而出现「判断力让渡」的现象;即便附有叙事说明,AI 的框架仍可能在不知不觉中锚定评审者的思路。该研究将「original judgment」(原始判断)视为组织最稀缺的竞争力来源之一,并呼吁管理层重新审视 AI 在评估与决策链条中的位置。
实践启示
对于日常依赖 AI 辅助决策的管理者而言,这项研究的提示包括:
- 区分「AI 给结论」与「AI 给框架」,尽量保留人类独立形成判断的环节;
- 在关键评审场景中,要求 AI 输出可追溯的推理依据,而非仅给最终分数;
- 定期进行「无 AI」评审基线对比,避免团队对模型形成隐性依赖。
研究的具体数值结果在原文摘录中尚未完整呈现,但所提出的方法论——以人类专家为基准、对照不同 AI 介入强度——为后续讨论 AI 与人类判断的交互提供了可复用的研究范式。
