谷歌Gemma下载破10亿,AI助力癌症治疗新突破
谷歌Gemma开源模型累计下载量突破10亿,基于其构建的AI模型在癌症免疫治疗中取得新进展。
谷歌DeepMind宣布其开源模型系列Gemma累计下载量正式突破10亿大关。同时,基于Gemma构建的27B参数AI模型C2S-Scale在癌症免疫机制研究中取得突破——首次通过AI提出全新机理性治疗假设,并在活细胞实验中得到验证。
从零到十亿:开源生态的里程碑
2024年2月,谷歌首次发布Gemma开源模型,仅有2B和7B两种规格。作为旗舰Gemini的「轻量开放」分支,Gemma主打本地化部署,开发者可直接获取权重,在个人电脑、手机和边缘设备上运行。
上线两年半后,Gemma累计下载量正式突破10亿。伴随这一里程碑,谷歌同步推出官方GitHub仓库「Awesome Gemma」,集中收录社区微调模型、教程、开发者工具及各类衍生应用。
Gemma下载量增长轨迹:
- 2025年3月(一周年):突破1亿
- 2025年12月:超过3亿
- 2026年4月(Gemma 4发布时):超过4亿
- 今年第二季度:超过9亿
- 目前:突破10亿
衍生变体破10万:从太空到海洋
Gemma的开源生态已衍生出约10万个变体,应用场景远超传统AI工具:
- 入轨NASA卫星:在太空中高性能GPU上运行,创造了「大模型首次在太空工作」的纪录,并向地球发出第一条信息「地球人,你好」
- 接入1亿台手机,覆盖大众日常使用
- DolphinGemma破译海豚声音:通过接收海豚叫声、分析重复模式并预测下一声音节,探索海洋生物通讯方式
C2S-Scale:把细胞写成一句话
在Gemma的众多应用中,最具突破性的是其在癌症免疫治疗领域的贡献。谷歌DeepMind、谷歌Research联合耶鲁大学,基于Gemma开发了27B参数的Cell2Sentence-Scale 27B(简称C2S-Scale),相关论文已在bioRxiv发布。
该模型的核心创新在于「细胞即句子」的设计思路:把单细胞测序产生的高维向量数据,按基因活跃程度从高到低排列,转换为由基因名组成的「句子」。这种朴素转换使模型无需修改Gemma架构即可直接「阅读」细胞数据,并同时处理论文摘要、细胞元数据等纯文本信息。
4000种抗癌药虚拟筛选
研究团队瞄准癌症免疫治疗中长期存在的难题——「冷肿瘤」。通俗而言,免疫系统识别异常细胞依赖细胞主动「举牌」(即将内部蛋白碎片挂到表面,即抗原呈递),而「冷肿瘤」不举牌,再先进的免疫治疗药也打不到隐形靶子。
C2S-Scale的核心实验设计被称为「双上下文虚拟筛选」(dual-context virtual screen):
- 世界A(免疫上下文阳性):真实患者原发肿瘤样本,含微弱干扰素信号
- 世界B(免疫上下文中性):培养细胞系数据,完全无干扰素活动
团队将4000余种药物逐一投入两个「平行世界」模拟,寻找「仅在A中起效、在B中无效」的候选者。模型命中结果中,仅10%-30%曾在过往文献中被提及,七成以上与该筛选目标毫无已知关联。最终胜出的是silmitasertib(CX-4945),一种CK2激酶抑制剂,被模型标注为「context split」(上下文劈叉)。
活细胞验证:抗原呈递提升约50%
假设需经活细胞实验验证。团队采用人源神经内分泌细胞模型(该模型从未出现在训练数据中),设置三组对照:
- 单用silmitasertib:抗原呈递无变化
- 单用低剂量干扰素:轻微提升
- 联合使用:抗原呈递提升约50%
这是AI首次提出全新的机理性治疗通路,并在活细胞中得到实证。研究团队在论文中表示,C2S-Scale真正给出了一个可以被验证的新机制方向。
