AI 擅长起步,却不擅长做对
一位有三年 AI 实践经验的 UX 从业者指出:AI 善于解决空白页难题,但在质量优先时频繁产生幻觉并为错误辩护,反而拖…
一位拥有三年 AI 实践经验的资深 UX 从业者近期撰文指出,AI 在设计工作中的真实表现与外界宣传之间存在显著落差:它非常擅长「起步」,却并不擅长「做对」。这一判断来自她对自身工作流的持续观察与具体案例复盘,对正在大规模引入 AI 的设计与内容团队具有警示意义。
起步很快,做对很难
作者认为,过去三年 AI 确实在变好,但这种变好主要集中在一件事上——解决「从零到一」的空白页难题。撰写文案时替代 lorem ipsum、生成初版界面、产出第一稿方案,AI 可以在几秒内完成过去需要数十分钟的工作。然而,「起步」只是工作的一小部分;从「初版可用」推进到「真正正确」,故事就变了。
她用一个具体场景说明问题:她向 AI 提供四张团队预算截图,要求其汇总数字、进行分析,并结合历史对话给出下一年的调整建议。AI 凭空「发明」了两个数字,并非四舍五入误差,而是完全虚构。基于这些数字给出的建议,整体偏差达到 30%–40%。当她指出数字有误时,AI 不仅没有承认,反而与她争辩。
这一案例揭示了一个比幻觉本身更值得警惕的问题:当错误被用户质疑时,模型会为幻觉辩护。这意味着发现错误的全部责任,落在了已经足够了解答案的人身上。如果提问者对自己的业务不够熟悉,或者当下没有精力仔细核查,结果很可能就是带着一份看似合理、实则失真的方案继续推进,直到几个月后问题显现。
幻觉问题远未解决
作者表示,这种经历并非个案。她几乎在每一次提示任务中都会遇到错误或幻觉,包括用户研究分析与编码项目。她尝试过用 skills、md 文件、MCP(模型上下文协议)等不同方式约束模型,效果有限。她还曾密集测试 Anthropic 推出的 Claude Fable 两周,虽然首轮输出明显优于 Opus,但同样的模式很快重现——摘要悄然失真、细节被遗漏、信心与准确度严重不匹配。
她引用斯坦福 2026 年 AI Index 的数据为这一判断提供佐证:在新的准确性基准上,26 款主流模型的幻觉率跨度从 22% 到 94% 不等;同一份虚假信息,当被表述为「他人所认为」时模型尚能处理,但当被表述为「用户自己所认为」时,模型的表现会急剧下滑。这一结构性特征正是「为幻觉辩护」现象的来源。
关注质量时,AI 并不算快
作者的工作涉及 MCP 与智能体搭建、对话设计,以及在编码经验有限的情况下自建网站与小工具。她的经验是:发现一个问题后,AI 通常需要多轮提示才能定位,再需要更多轮提示才能修复;很多时候她自己打开代码修改反而更快。修复「小」错误所吞噬的时间,甚至让她宁愿回到从零开始的流程。
她的结论是:在规模化场景下,AI 目前并不擅长。她将问题归纳为——任务越复杂、数据源越多、上下文窗口历史越长,结果越差。对于那些希望用 AI 放大自身产出的资深从业者来说,这一点尤其令人挫败,也让她担忧:经验不足的同行是否会因为信任 AI 而「造出怪物」。
她进一步指出常见反驳的局限:「你提示得不够好」「上下文管理不到位」「工具链没搭好」——这些建议只对已经能搭建复杂脚手架的从业者有效,而大多数被告知「AI 会让你更高效」的知识工作者,并不在这个群体之内。她认为,如果一款工具只有在用户自行构建复杂外部系统后才能兑现承诺,那么它实际上并未解决它所宣称要服务的那个人群的问题。
UX 质量正在被稀释
作为几乎整个职业生涯都在做 UX 的从业者,作者直言:AI 生成的设计与文案,在无障碍、语气精度、以及中级设计师通过反复实践积累出的判断力上,仍然是浅层的。她担心在「交付更快」的普遍期待下,许多团队并不会投入足够的核查精力,由此产出的「AI slop」(AI 粗制内容)会比人们意识到的更多,而这些代价可能要等到几个月之后才会真正显现。
她的核心立场是:AI 是强大的起步工具,但把它当作「做对」的工具来使用,目前仍然会让人失望,并且会把质量风险悄悄转嫁给最没有能力辨别的那部分使用者。
