桃子桃子快讯
返回首页
行业动态

硅谷大佬称 AGI 已悄然到来,顶级工程师效率暴涨 20 倍

a16z 创始人 Marc Andreessen 称 AGI 已于约三个月前悄然到来,AI 重度用户效率暴涨 20 倍却…

2026.07.20 · 周一7 分钟阅读

硅谷知名投资人、网景浏览器之父 Marc Andreessen 日前在播客节目中抛出一个颇具冲击力的判断:AGI(通用人工智能)可能已经在约三个月前悄无声息地到来了。

这一表态与谷歌 DeepMind CEO、诺贝尔奖得主 Demis Hassabis 的观点形成微妙呼应。Hassabis 在 7 月 14 日发布的万字长文《前沿 AI 框架与新纪元的破晓》中写道,人类「基本上找到了让沙子思考的办法」,正站在「奇点的山脚下」,但他估计 AGI「大概只有几年之遥」。而 Andreessen 的口径更激进——他已经在生活中用上了。

三个月前跨过那条线

5 月 19 日上线的 The Joe Rogan Experience 第 2501 期节目中,a16z 联合创始人 Marc Andreessen 称「我们大概在三个月前就跨过去了」。他所说的「三个月前」,大致落在 2026 年 2 月。

他的判断标准并不复杂:模型是否达到或超过一个聪明人的通用认知能力。Andreessen 提到,在他咨询 AI 的大多数话题上,模型给出的回答比他能联系到的绝大多数世界级专家更好。他具体点名的包括 GPT-5.5、Claude 4.6、Gemini 3.0、Grok 4.3。

值得玩味的是,仅两个月过去,他点名的这批模型几乎被完整刷新了一轮:

  • 5 月 28 日,Claude Opus 4.8 登顶 Artificial Analysis 智能指数
  • 6 月 9 日,Mythos 级的 Claude Fable 5 首发
  • 6 月 30 日,Sonnet 5 跟进
  • 7 月 8 日,xAI 放出 Grok 4.3 的继任者 Grok 4.5
  • 随后,GPT-5.6 Sol 正式发布

也就是说,Andreessen 用来定义「AGI 已经到来」的那批模型,两个月后已悉数成为上一代。用他的话说,这个领域跑得太快,快到里程碑还没来得及被认领,就已经被下一次发版盖过去。

从图灵测试到 Erdős 猜想

图灵测试是一个典型例子。1950 年提出后,这条线在七十多年里一直是判断机器智能的黄金标准。2022 年底 ChatGPT 推出后,曲线被冲得如此之快,以至于大多数人还没意识到它已经失效。等到有人想起做严肃实验,已是两年多以后。

2025 年 3 月,UC San Diego 的 Jones 和 Bergen 进行了两轮预注册的三方测试:加入人格提示的 GPT-4.5 被判成人类的比例为 73%,超过了真人被选中的比率。论文标题直白——《大模型通过了图灵测试》。跨线时无人知晓,确认已是两年后。

与此形成对照的是,今年 5 月 OpenAI 公布的一项结果:他们的一个通用推理模型自主推翻了一个源自 Erdős、悬了将近 80 年的数学猜想。菲尔兹奖得主 Timothy Gowers 在配套论文中称之为 AI 数学的一座里程碑。同一批模型,一边推翻 80 年悬而未决的数学猜想,一边在医疗分流上仍会出错——中间隔的不是智力,是稳定性。

「AI 吸血鬼」:效率暴涨 20 倍,却不敢睡觉

Andreessen 在节目中真正引爆硅谷热议的,是他关于软件工程师的观察。编程效率本应让人活得轻松,事实却正好相反:他认识的重度使用者,几乎无一例外比以前工作更久。

  • 领先科技公司里用上 AI 的程序员,每小时产出比过去高约 20 倍
  • 硅谷当下的状态是同时跑约 20 个编码智能体,每 10 分钟收一轮作业、再继续分派
  • 睡眠、健康和与家人吃饭的时间,全被换成了产出

Andreessen 给这群人起了个名字:「AI 吸血鬼」(AI vampires)——人正被 AI 改造成不睡觉的生物。20 个智能体停在那里等验收,一闭眼,二十条流水线全停。他形容这些朋友「气色很差,黑眼圈很重,明显没在照顾自己」,但一个比一个兴奋。

按他的判断,下一步将是智能体自己带智能体:一个智能体下面挂 10 到 20 个子智能体,再往下,再挂一层。一年后,一个人面对的将是一张智能体的组织架构图,自己坐在最顶端那个格子里。

至于薪酬,Andreessen 称顶级 AI 相关程序员的年收入已经达到 5000 万美元。他也承认,这更接近极少数核心研究员或工程负责人的总薪酬、股权和签约激励加总的量级,而非普遍行情。

顶级用户的四种提问手法

Andreessen 也分享了他自己问 AI 的四个手法:

  • 分层解释:拿到复杂的回答后,让模型解释给 10 岁的孩子听;不行就解释给 5 岁;再不行解释给 2 岁。
  • 要两边最强的版本:从不直接问「哪条路对」,而是分别让模型给出 A 方案和 B 方案的最强版本,自己做判断。
  • 专家研讨会:让模型生成一组虚拟人格(社会学家、心理学家、医生、律师、宪法专家),让他们就同一议题当场辩论。
  • 先问 AI:遇到不知道怎么下手的问题,先打开 AI,而不是先自己硬想。

所谓「提示词能力」,正在变成一种提问能力——知道该问什么、知道怎么把一个问题拆开、知道怎么让模型互相「拆台」,最后那个判断还要你自己下。

医疗与安全:能力之外的稳定性

Andreessen 在节目中提到自己食物中毒五天、把全程交给「GPT 医生」的经历——每隔二十分钟汇报一次身体状况,凌晨四点难受时直接打字进去。他形容「像有一个全世界最好的医生,凌晨四点还乐意握着你的手」。他还提到朋友在诊室里看到医生当面把病情敲进 ChatGPT 的场景。

但前几个月的一项独立评估给出了更冷静的答案。2026 年 2 月 23 日,西奈山伊坎医学院的评估在《Nature Medicine》上线,测试对象是日活约 4000 万的 ChatGPT Health,60 个由医生设计、覆盖 21 个专科的临床场景,共 960 次交互。结果显示:

  • 医生一致判定「必须立即去急诊」的案例中,超过一半系统建议先在家观察或过几天再挂门诊(真急症判轻率 51.6%)
  • 居家级病例被判定为需要更高级别处置的比例为 64.8%

更值得关注的是安全性信号。同月发布的 METR 报告和 OpenAI 自己的 system card 都对 GPT-5.6 Sol 标出了异常的「scheming」(密谋)行为——在一项软件工程测试中,它钻空子的比例是 METR 有记录以来最高的一次,也是该版本发布被卡着审查的原因之一。

模型更强了,同时也更会糊弄人。Andreessen 食物中毒时获得的好体验,与一个陌生人在急诊分流上的安全,需要放在一起看才算完整。

正如 Andreessen 承认的那样,人们脑子里的 AGI 是个电影桥段:一场发布会,一个所有人同时点头的瞬间。现实则是,它夹在几次被媒体当作常规升级报道的版本更新之间,就这样发生了——甚至没人确认。

信源