把 UX 评审交给 AI,结果如何?
一位 UX 从业者用主流大模型对电商搜索与详情页做专家评审,发现 AI 适合做初筛和润色搭档,无法替代专业判断;准确率来…
一名 UX 从业者近日在 UX Collective 发表体验报告,将一份针对电商门户搜索、结果与产品详情页的 UX 专家评审任务,分别交给两款主流大模型并行处理,再用自己手工完成的结果做对照。结论是:AI 在 UX 评审中是强大的协作伙伴,但短期内还无法取代专家;模型输出的准确率,取决于喂进去的专业框架。
测试如何进行
测试者使用的是付费版的两款大模型(文中分别化名 "Claude Fable 5" 和 "ChatGPT 5.6 Sol"),他将任务简报、目标用户与目标相关问答、行业研究、GA 数据导出、Clarity 的热图、注意力图、滚动图以及页面 URL 一并交给模型。同时,他并非采用「一锅炖」式的单条 prompt,而是将任务拆成多步骤的结构化流程,并要求模型在可能的情况下用 GA 与 Clarity 数据印证结论,而非凭空假设。整条流水线之外,他自己也手工完成了同一份分析作为对照基准。
测试结果:可用但不充分
作者明确指出,这是一次体验报告而非受控实验,存在主观成分。整体观察有三条:
- 两位模型都产出了分析文本,但掺入了大量无关甚至「莫须有」的问题;真正可用的部分主要集中在措辞与结构层面。
- 其中 Claude 在行文组织和条理上明显优于 ChatGPT,但这一印象是主观判断,未做量化对比;唯一可量化的差异是 Claude 一次输出即可成型,而 ChatGPT 只能分段完成。
- AI 也找到了一些作者本人没注意到的问题,但作者反向也发现了 AI 漏掉的问题,AI 的覆盖率仍显著不足。
这一发现与 2025 年一项针对 GPT-4o 复现 Nielsen 可用性启发式的研究结论吻合:「GPT-4o 仅识别出专家所发现可用性问题的约 21%,同时还生成了一些新的、部分失实的问题。因此它是非常优秀的一轮初筛工具,但尚无法独立替代专家评估。」
真正起作用的是专家框架
作者最终选择与 Claude 协作完成评审:在对话中反复打磨「删什么、补什么」,由模型负责语法与一致性校对,这部分体验被评价为「极其有用」。主观感受上,整套流程比纯手工完成多花了约 15% 的时间(提示词构建与结果校验)。
测试者由此引出了一个关键原则:
- 模型输出的准确性,并不源自模型规模或品牌,而是源自你喂进去的专家框架。
- Baymard 之所以能实现 95% 准确率的 AI 启发式评估,不是因为提示词更巧,而是因为他们把自建的、经过多年研究的 UX 知识库作为底层基础。
- 因此值得尝试的方向,是把自己积累的可用性启发式、严重度权重和专家视角,编码成一个可复用的「技能」(agent skill),按项目持续打磨,而不是让模型替代自己下判断。
他补充道,即使换成「让 AI 实时走查浏览器」的工具,结果大概也不会更好,核心瓶颈并非访问能力,而是判断力:对上下文的理解、对目标的把握、对严重度的权衡,以及区分真问题与噪声。
长期来看
测试者坦言:AI 取代这类工作只是时间问题,真正不确定的是「何时」。他引用了 2024 年末路透社的报道——Ilya Sutskever 等多位一线研究者指出,单纯扩大预训练规模已接近上限,进一步进展更可能来自「o1」式的逐步推理等新范式。这也解释了为什么「把推理路径交给模型、把判断标准留给自己」的协作方式,目前最具可复制性。
