AI 正在吃光互联网,人类知识牧场还能长草吗
AI 流量已超过人类网民,高质量语言数据或在 2026 年枯竭,Stack Overflow 提问量暴跌,模型坍缩风险浮…
AI 正在以前所未有的速度吞噬互联网上的公开内容,而支撑下一代模型训练的人类知识牧场,正在迅速变薄。这是 Cloudflare 在近期财报会议上的预测:5 年后,AI 产生的流量将达到人类网民的 1000 倍。事实上,AI 访问量已经在当下正式超过人类。语言模型的训练预计将在 2026 年至 2032 年间耗尽人类公开文本数据,其中高质量语言数据的枯竭甚至可能提前到 2026 年——比整体公开文本耗尽还要早两年。
Stack Overflow 的提问荒
Stack Overflow 曾是全球程序员的集体大脑。2008 年建站至 2014 年鼎盛期,每月可吸引逾 20 万个新问题,构筑了一座庞大的人类技术问答档案。但 ChatGPT 出现后的两年间,平台月提问量从逾 20 万跌至不足 5 万,几乎倒退回 2009 年的水平。
根据 Stack Overflow 2025 年调查:
- 84% 的开发者每天都在使用 AI 工具。
- 46% 的开发者不信任 AI 输出的准确性,主要顾虑是 AI 给出「看起来正确但差一点」的回答,容易让人放松警惕。
- 约 35% 的开发者表示,访问 Stack Overflow 是为了修复、调试 AI 制造的问题。
研究还发现一个更值得警惕的现象:通过对 24,304 名活跃贡献者在 ChatGPT 推出后 17 个月里的行为分析,技术最精湛、声誉最高的用户反而最倾向离开平台;无人回答的问题比例从 19.9% 升至 25.7%,整体真实贡献量下降约 35%。Stack Overflow 的知识训练了 AI,AI 带走了它的提问,开发者又回到 Stack Overflow 寻找修复 AI 的方法——而如果没有源源不断的新问题,旧答案也会逐渐过时。五年前的答案未必知道今天刚发布的框架与新漏洞。
公地悲剧在 AI 时代重演
经济学中的「公地悲剧」描述了共享资源被过度使用直至崩溃的过程。Stack Overflow 的投票机制、维基百科的编辑文化,都建立在「你贡献、别人也贡献」的隐性社会契约之上。但当 AI 以接近零成本提供足够好的答案时,分享专业知识的边际收益便迅速萎缩。
一位有 20 年经验的数据库架构师花三小时写一篇 PostgreSQL 调优深度文章,任何人用一句话就能让 AI 生成类似内容。坚持原创分享所需的内在动力在减弱,而能持续供给这种动力的人在任何群体里都属少数。其结果是高价值知识可能加速流向企业内网、付费社群与私密聊天,而公开知识生产减少,又将进一步压缩 AI 的高质量训练数据来源。
模型坍缩:计算机科学版本的近亲交配
互联网曾是一座由无数陌生人在 BBS、维基、论坛中共同建造的人类知识大教堂。AI 从中学会了说话,但教堂的新访客与新砖瓦越来越少,AI 开始用自己的回声填补沉默。
2024 年 7 月,曾任职于 Google DeepMind 的研究科学家 Ilia Shumailov 等人在《自然》期刊发表论文《AI models collapse when trained on recursively generated data》,指出:
- 大型语言模型、变分自编码器等在被反复用自身生成内容训练时,性能会出现退化。
- 早期表现为稀有模式消失,晚期则整体输出趋向单调、漂移到平均值附近,并产生离群点。
- AI 生成内容大量涌入互联网后,反馈循环中的误差会持续叠加,导致模型与真实世界分布之间的偏差越来越大。
美国主流科学媒体在报道中引用了一个传神说法:「用 AI 生成的文本来训练 AI,是计算机科学版本的近亲交配。」
知识牧场如何长出下一茬草
一个更根本的问题是:15 年后,当 AI 在大多数知识领域达到「专家级」水平,谁还有足够的知识储备去辨别 AI 答案的正确性?世界经济论坛 2026 年的文章指出,AI 能力越强,人类有效监督反而越弱——因为人类承担的认知工作越来越少,对相关工作的第一手掌握也随之消退。有人提议像要求飞行员定期手动飞行一样,要求 AI 用户独立完成高难度认知任务,建立能力审计机制,确保人类判断力不会在不知不觉中萎缩。
AI 的加入或许会逼迫知识生产走向「不可被替代」的深水区,但这需要一个前提:认知劳动的价值被看见、被承认、被回馈给创造者;同时需要给下一代保留不依赖 AI 独立学习和犯错的机会。人类文明的集体智慧不是已下载完成的数据包,而是由集体记忆、注意力与推理组成,需要活着的人持续争论、修正和补充。AI 可以蒸馏过去的知识,却无法凭空创造一群愿意为未来负责的人。模型需要算力与 Token,但同样需要那些走进真实世界、发现新问题并把答案公开留下来的人。
