桃子桃子快讯
返回首页
研究论文

AI 加人未必更强:八项实证研究揭示人机协作真相

综述八项对照研究与一项 Nature 元分析发现,人机协作效果因任务而异,决策类任务中 AI 辅助反而拖后腿。

2026.08.12 · 周三4 分钟阅读

多数企业推行 AI 时有一个看似合理的默认假设:熟练员工配合 AI 工具的表现,必然优于人或 AI 任一方单独作业。然而,一项梳理八项对照实验、并与《自然·人类行为》(Nature Human Behaviour) 大型元分析相互印证的综述指出,这一直觉并未被证据支持。AI 在某些任务上确有可复现的明显优势,但在另外一些看似相近的任务上,人机协作反而会拖累表现,甚至让优势消失。

研究方法:八项实验如何选出

作者在 Google Scholar、Semantic Scholar、PubMed、SSRN、NBER、arXiv、ACM 数字图书馆与 IEEE Xplore 上进行结构化文献检索,入选标准包括:比较「人单独」、「AI 单独」、「人+AI」三种条件中的至少两种;使用真实或拟真工作任务而非自报满意度;报告准确率、速度、质量评分或错误率等量化结果;经同行评审或来自正规研究机构;覆盖临床诊断、知识工作、客服、写作、软件工程等领域。

初步筛出约 24 项候选,多数因自报时间分配、非随机观察设计、缺少三方对照等原因被剔除。最终保留的八项研究设计差异明显:多数为随机对照试验,有一项是分阶段现场部署并附带随机试点;最短任务仅 20 分钟,最长的则跨越三家公司、追踪真实生产工作数月。

与更大规模元分析相互印证

为检验八项研究的结论是否仅为样本巧合,作者将其与 Vaccaro、Almaatouq 与 Malone 2024 年发表于《自然·人类行为》的元分析相互对照,汇总了 106 项实验、370 个效应量,比较人单独、AI 单独、人机协作三种条件。其核心发现是:人机协作的平均表现弱于双方中较优的一方,且效果随任务类型发生翻转——决策类任务中「组合」反而拖后腿,内容创作类任务中「组合」则有帮助。综述认为,这一任务依赖的结论并非八项研究的偶然特征,而是与更大范围文献的发现高度一致。

覆盖的任务类型与典型研究

综述选取的八项研究横跨五大领域,包括临床诊断、管理咨询、客服支持、专业写作与软件工程。代表性研究包括:

  • 临床诊断:2024 年 10 月 28 日发表于《JAMA Network Open》的一项单盲随机临床试验,由斯坦福、贝斯以色列女执事医疗中心与弗吉尼亚大学联合开展,纳入 50 名持有美国执照的医生(26 名主治、24 名住院医,中位执业年限 3 年),随机分为两组,在最多六项临床病例上比较独立诊断与 AI 辅助诊断的表现(原文在此处被截断)。
  • 知识工作:参考了 NBER Working Paper 33795 对 7,000 多名 Microsoft 365 Copilot 实际使用者的时间分配调查,以及对 GitHub 上 72,000+ 拉取请求的观察研究(因非随机设计,仅作为补充证据)。
  • 历史参照:Peng 等 2023 年的预印本被保留,作为后续更强研究的历史前身。

启示:不是「要不要用 AI」,而是「在哪用 AI」

综述的最终落脚点并非否定 AI,而是反对「AI 在哪里都帮助」的一刀切叙事。当任务边界清晰、结果可量化、可验证时,AI 单独或 AI 辅助往往胜出;而当任务依赖情境判断、需要人对 AI 输出做交叉校验时,AI 反而可能让人分心、拖慢节奏。对企业部署者而言,关键问题不是「要不要用 AI」,而是「在哪些具体任务上用 AI、由谁来兜底、如何评估效果」。把 AI 当成万能加速器前,先做小范围对照实验,往往比一份宏大的推广计划更划算。

信源