诺奖得主 Doudna 团队用 AI 造出全新基因剪刀,切割效率反超天然版本
Doudna 团队与 Profluent 公司分别用 AI 设计出自然界不存在的 CRISPR 酶,部分指标优于天然 S…
2025 年 7 月 16 日,Nature 与 Science 同时刊出重磅研究:诺贝尔化学奖得主 Jennifer Doudna 团队与蛋白设计公司 Profluent,分别用 AI 设计出自然界中从未存在过的 CRISPR 核酸酶。两者在人类细胞中的部分编辑指标,反超被广泛使用的天然版本 SpCas9。
蛋白设计:被卡了十几年的难题
CRISPR 之所以能精准编辑基因,核心在于 Cas9、Cas12 等核酸酶这把「分子剪刀」。它们都是从细菌身上「借」来的天然零件,尺寸和脾气并非为人类需求定制。想要更小、更准、免疫原性更低,过去只能靠人工逐位点突变。
问题在于蛋白太大。一个 Cas9 蛋白往往超过 1000 个氨基酸,理论序列空间达 20 的 1000 次方,远超可观测宇宙的原子总数。在这片近乎无限的搜索空间里,能用的序列极其稀疏。过去几年同类 AI 工作敢改动的幅度普遍只有 1%–2%,多改一点酶就失去活性。
Doudna 团队:用 AI 改掉 30% 仍能工作
Doudna 团队选择的靶点是 TnpB——一类比 Cas9 更小、在进化上是 Cas12 祖先的微型核酸酶。研究流程分两步:
- 第一步,把目标蛋白的三维结构喂给 AlphaFold2,再用 ESM-IF1 反向生成数千条「能折成这个形状」的氨基酸序列;
- 第二步,训练第二个模型,把实验室积累的海量实验数据全部灌入,让它学习蛋白各片段之间的功能约束,筛掉「形似而神不似」的方案。
最终合成的核酸酶在细菌、植物与人类细胞中均能完成编辑,部分插入与缺失效率高于天然版本。整条合成序列与天然 TnpB 的差异约为 30%——相比同类工作 1%–2% 的改动幅度,这是一项反常识的突破。论文在 Science 经过了同行评审。
Profluent:从头造一把地球上没有的剪刀
蛋白设计公司 Profluent 走了另一条路:不改 TnpB,直接生成全新的 Cas9。
- 从 26 TB 基因组与宏基因组数据中挖掘出 510 万个 CRISPR-Cas 蛋白,构建数据库;
- 用蛋白语言模型从中生成全新序列,序列多样性达到自然界已知水平的 4.8 倍;
- 挑出 48 条送入人类细胞做功能验证,表现最好的被命名为 OpenCRISPR-1,并以开源形式公开。
OpenCRISPR-1 的实验数据如下:
- 靶向编辑效率:55.7%(SpCas9 为 48.3%);
- 脱靶编辑率:0.32%(SpCas9 为 6.1%),降幅约 95%;
- 与 SpCas9 相差 403 个突变,与数据库中任何天然蛋白相差至少 182 个突变。
这条序列是真正意义上的「全新设计」——地球上没有它的天然对应物。相关预印本 2024 年 4 月已挂 bioRxiv。
从「发现自然」走向「设计自然」
把两条研究线放在一起看,真正发生变化的是范式:AlphaFold 解决的是「序列长什么样」,蛋白语言模型解决的是「什么样的序列才活得下去」,而本次工作推进到第三级——造一段自然界从未写过、却能在活细胞里干活的序列。
苏黎世大学分子生物学家 Soeren Lienkamp 评价道,CRISPR 让人类得以随心所欲编辑 DNA,而基于 AI 的蛋白设计,正在让人类在蛋白空间中创造全新性质。这与文本大模型的思路如出一辙:喂足够多的数据,学出内部语法,再生成训练语料里没有的内容。
不过,AI 写蛋白与 AI 写代码有一道根本差异:前者写出的东西跑在活细胞里,改写的是真实遗传信息,一次失误无法简单回滚。
现阶段仍需审慎
- 两项成果目前都止步于细胞实验,距动物实验、临床试验与药物审批仍有数年距离;
- OpenCRISPR-1 的数据来自 Profluent 自身公布,独立复现仍待时间;
- Doudna 与斯坦福大学 Le Cong 等研究者均强调,用天然核酸酶做的基础研究不能停——AI 模型跑得这么快,靠的正是过去几十年实验室一点点堆出来的数据。
Doudna 的总结是:AI 与生物学的未来形态,是 AI 工具帮我们跑得更快,但要把模型价值榨到最大,仍然需要真正懂分子机制的人。
