梁文锋 3 小时长谈还原:DeepSeek 的克制与押注
DeepSeek 创始人梁文锋在一场泄露的 3 小时交流会中,系统阐述其聚焦语言模型、押注持续学习、克制商业化的路线图与…
DeepSeek 创始人梁文锋近期一场长达约 3 小时 44 分钟的内部交流会内容被泄露,原文未能公开流传,但雷科技从中梳理出梁文锋关于技术路线、算力约束与商业化克制的核心论述,呈现了一家被估值数百亿美元的国产大模型公司,如何在资金、算力、生态均不占优的条件下,押注一条相对独特的发展路径。
战略取舍:不做视频生成与世界模型
梁文锋承认,2024 年初 Sora 发布后,国内外同行纷纷跟进视频生成,「如果你不做,你就不是一个 AI 公司一样」,但他判断视频生成只是「跟搜索一样的组件」,与智能本身的上限无关。3D 生成、世界模型在他看来也都不是 DeepSeek 的主线,多模态会被做,但定位是工具而非智能进化本身。
在此基础上,梁文锋勾勒出一条相对收敛的路线图:
- 底层:语言模型
- 上层:思维链
- 再上层:Agent
- 关键节点:持续学习
- 终极目标:「自我迭代的奇点」
- 最后一步:具身智能
他的取舍标准非常直接:「一件事在不在这条路线上?不在就不做,哪怕它在商业上是个好生意。」梁文锋同时承认,「每个公司它的判断是不一样的」,并提示 OpenAI、Anthropic 与 DeepSeek 三家未来会「交替上升」。
核心难题:持续学习是全行业未解之题
梁文锋对当前 AI 能力边界有一个清晰的概括:在给定上下文内,AI 表现已可超过人类,「但前提是你必须把完整的上下文给它,现实中做不到这一点」。他以新员工入职需要两个月熟悉环境为例,说明 AI 缺乏这种渐进式学习过程,并把这一差距归结为核心问题——持续学习。
目前全行业都没有找到「非常 work 的方法」。DeepSeek 的差异化应对,是组织层面的:研究文化允许员工用一半时间自由探索,「谁都可以去摸」这个问题。但梁文锋也承认这个机制更接近于「摸奖」,更大概率可能摸不到。
算力账本:二十分之一算力追 12 到 18 个月差距
梁文锋给出了几个非常具体的数字:
- DeepSeek 现有约两万张 H 等效算力
- 美国头部模型激活参数 800B,国内「还在几十 B 的规模,差一个数量级」
- 训练同样规模模型需要五万张 GB300 或二十万张国产算力卡
- DeepSeek 获得的国产配额是一万六千张,比互联网大厂少一个数量级
应对策略分两层:一是承认差距但追求效率,目标是用「几分之一的算力」把时间差从 12–18 个月缩到 3–6 个月;二是押注国产替代,通过自研 TileLang 编译器绕过英伟达 CUDA 生态,他判断一年内国产芯片生态问题可基本解决。但他也明确表示「根本不会考虑到那么大的规模上去跟美国竞争」,只能「在几十 B 激活的规模上先把它做好」。
克制商业化:与 OpenAI 同样承诺的不确定性
梁文锋反复强调克制:「OpenAI 一开始觉得他真的能够垄断这个世界……他会被另外一个愿意只占百分之一的人打败。」他本人给 DeepSeek 设定的目标是「只赚一个合理的利润,十个月收回硬件成本就够了」,并把团队稳定定义为「唯一的核心利益」。
但雷科技指出,OpenAI 从非营利到有限利润再到全面商业化的转变,本身就是「知易行难」的注脚。梁文锋的期权激励建立在公司估值持续增长之上,又与「克制」形成内在张力。开源方面他同样加了前提:「前提是我们只赚六倍利润」。目前 DeepSeek 的 API 定价已使其成为大量开发者的默认选择,但未来资本市场是否仍接受这一回报上限,是悬而未决的问题。
梁文锋自己其实也为最坏情况准备了保底:即便技术不再突破,「靠卖 API 也能支撑一家上市公司」。在一个更看重 Agent 落地与性价比的行业阶段,DeepSeek 的定价策略本身已经构成一种结构性优势。
