桃子桃子快讯
返回首页
行业动态

AI 药物发现:数据闭环为何难以打通

AI 正重塑药物早期筛选流程,但训练数据质量、发表偏倚与造假风险正成为模型迭代的瓶颈。

2026.07.27 · 周一4 分钟阅读

AI 正在加速渗入药物发现的最早期环节,但训练数据的稀缺、偏倚与造假风险,让这场变革卡在「数据闭环」尚未真正打通的节点上。MIT Technology Review 近日发表的深度报道指出,AI 能压缩前端筛选时间,却无法替代临床阶段的验证;而真正制约模型继续往前走的,是高质量、尤其是「负面数据」的长期匮乏。

从经验筛选走向预测式设计

药物研发向来是一场高风险长跑。自 1950 年代以来,新药研发成本大约每九年翻一倍,这就是业界熟知的「反摩尔定律」(Eroom's Law)。如今一款新药从立项到上市平均需要 10 至 15 年、烧掉 10 亿到 25 亿美元,临床失败率超过 90%。AI 被寄予厚望,被视为压缩周期、提升命中率的关键变量。

在「苗头化合物识别」(hit identification)环节,行业正在发生明显转变。全球生命科学公司 Cytiva 的蛋白研究战略总监 Paul Belcher 观察到,药企正从依赖物理筛选化合物库的经验模式,转向用 AI 直接设计候选分子,并预测其与疾病靶点的相互作用,再决定是否投入真正的研发资源。「AI 让企业不再受限于能物理筛选多少分子,」Belcher 表示,「它还能在实验室测试之前淘汰低质量候选,节省大量时间与资源。」

不过他同时强调,AI 目前还无法可靠地预测化合物的动力学行为与可开发性,因此每一个由 AI 生成的候选分子,仍需要在实验室里被逐一验证。这意味着传统的高通量筛选流程——以二元判断、阈值方式快速给出「是/否」答案——已经不够用,实验团队必须对数量更多、结构更复杂的候选物进行精细表征与纯化。

撞上「数据墙」与发表偏倚

当模型加速吞噬数据的同时,也把数据本身的问题摆到了台面上。Belcher 把当前 AI 在制药领域的处境称作撞上「数据墙」:大量早期模型都建立在公开数据集上,不同团队看到的是同一批数据,结论日益趋同,边际收益迅速衰减。更麻烦的是,这些数据集最初并非为 AI 而建,结构、标注与多样性都难以满足现代模型的需求。

更深层的障碍来自发表偏倚。Belcher 指出,绝大多数公开数据集与科研论文只展示阳性结果,失败实验几乎从不公开。「这种偏倚几乎等同于一只手被绑在背后,」他说,「AI 模型能识别与成功相关的模式,却缺乏对失败的全面理解,预测因此难以真正可靠。」他半开玩笑地呼吁,应该办一本专门刊登负面数据的期刊——那些「不结合的化合物」,此刻仍埋在各实验室的笔记本里,从未被系统化地回馈到训练集中。

生成式 AI 时代,数据造假被放大

数据完整性问题在生成式 AI 普及后变得更加尖锐。Belcher 援引荷兰微生物学家 Elisabeth Bik 在 2016 年的研究指出,约 4% 的生物医学论文存在图像重复或篡改;而那还发生在生成式 AI 让造假变得「轻而易举」之前。「在 AI 时代,被操纵或伪造的数据如果被用来训练模型,后果可能是灾难性的,」他警告,「必须有更多工具来验证数据是否被篡改。」

一些供应商已开始着手应对这一挑战。Belcher 提到 Cytiva 推出的 Image Integrity Checker 工具,采用与区块链相同的安全哈希算法来检测科学图像是否被篡改。他透露,已有出版机构开始考虑将其纳入标准流程,作为快速筛查文献真实性的手段。

报道最后指出,AI 药物发现的下一程,不再只是更大模型或更长上下文,而是把失败数据、阴性结果与图像真实性纳入训练闭环——这需要期刊、药企与仪器厂商共同补上数据基础设施的缺口。

信源