AI 看不到的人力劳动:为何大模型经济价值落地滞后
分析文章探讨大模型基准表现优异却经济落地缓慢的原因,指出生成式 AI 擅长定义明确的问题,而大量人类劳动难以规范化、难以…
OpenAI 联合创始人 Ilya Sutskever 在与 Dwarkesh Patel 的播客中抛出一个让业界困惑的问题:当前模型在各项基准测试上的成绩已经相当出色,但它们对真实经济的渗透速度却远远落后于预期。Sutskever 原话是:模型在某些情境下表现惊人,在另一些情境下却会重复输出自身,这种「既聪明又不聪明」的撕裂很难解释。这一观察在 AI 研究社区引发广泛共鸣:有研究者公开追问——模型在对话能力上早已超越人类四年了,自动化究竟在哪里?
生成式 AI 擅长的是「窄智能」
文章作者借助 Jay Kruer 的概括指出,今天的大模型本质上是「窄智能」的产物:它们在训练任务的小邻域内泛化良好,且只要目标函数能给出稳定奖励信号,配合大量并发智能体进行暴力搜索,就能在定义明确的问题上逼近帕累托前沿。Lean 定理证明器就是典型例子——它经过十三年领域专家的严格形式化沉淀,给出完全可验证的反馈。OpenAI 与微软在代码任务上的成功,本质上也受益于开源社区与 Stack Overflow 上数以万计「函数级、文档完备、问题与解法一一对应」的高质量数据,这些都是人类专家长期付费定义出来的成果。
「搭便车」式的训练数据来源
文章强调一个并不光彩但关键的现实:前沿实验室在大量「定义明确」的任务上几乎是在免费使用人类数十年甚至数百年的专家积累。从 Lean 与 MathLib,到开源代码与 Stack Overflow 解答,再到芯片设计、航空航天与部分医疗领域——这些场景的共同特征是,行业曾以高薪长期雇佣专家,把任务与解法形式化、文档化、规范化。模型今日的能力,本质上是站在这些「被规范化的人类知识」之上的。
软件工程之外的劳动大多无法形式化
把视野拉回「软件工程师」这一被讨论最多的职业。作者列出一份并不完整的清单:与客户及利益相关方沟通、基于对话提炼真问题、与产品经理对齐、将假设翻译为规范、测试、部署、质量保障与上下游交接、可观测性与成功指标的设计与追踪,以及对上述所有环节的复盘改进。其中能够套上「严格模式」描述的环节屈指可数。如果一家名为 EverythingAI 的公司试图训练模型覆盖以上全流程,立刻就会撞上递减收益——要自动化这些工作,必须先雇佣并培养资深人员去规范化原本由初级 QA 或开发完成的繁琐任务,而并不是每件事都值得自动化。
物理 AI 与更广泛的劳动力
Sutskever 们讨论的是高薪白领工作,作者提醒读者,白领之外还存在着大量在传统经济学意义上「没有直接经济价值」却不可省略的劳动——架梯子、搬运、清洁、照护等。密歇根经济学期刊指出,手工岗位的从业者短期内并不会被大语言模型直接取代;而当物理 AI 真正到来时,递减收益法则同样适用:很多琐碎任务并不创造直接经济收益,却对整个工作链条不可或缺。
「群体思维」的隐忧
文章最后提到一个元层面的警示:当整个行业中最聪明的人不约而同得出「看似不合常理」的结论时,需要警惕群体思维。作者并未给出明确答案,但提示读者保持独立判断。值得指出的是,原文在结尾处被截断,对物理 AI 与群体思维部分的完整论述未能呈现,读者可关注原文后续更新。
