桃子桃子快讯
返回首页
研究论文

Model Genome:通过公开文件指纹识别 LLM 是否从零训练

研究者发布 Model Genome 方法,通过架构、词表与权重三轴指纹,客观判断大模型是从零训练还是派生自既有开源底座…

2026.08.22 · 周六5 分钟阅读

近期,Model Genome 项目发布了一套基于公开文件即可识别大语言模型(LLM)「血统」的指纹流水线。当多家厂商宣称「自研、从零训练」的基座模型层出不穷,外界缺乏独立验证手段时,该方法提供了可复现的技术路径,并通过架构、词表、权重三个维度为模型打出一个直观的「基因型」。

核心问题:从零训练还是派生

在 Qwen、Llama、DeepSeek、Mistral 等开源权重底座之上继续预训练或微调,是业界通行的做法,本身并无问题。但部分厂商在发布「对标 DeepSeek」的自研模型时,并未明确披露与既有开源底座的关系。这类争议在 2026 年 7 月多家韩国机构发布大模型后被推向公众视野,其中一篇知乎相关讨论阅读量超过 270 万。Model Genome 的目标,就是用公开的 checkpoint 文件客观回答「这是从零训练,还是派生的」。

三轴指纹方法

轴一:架构指纹(config.json)

Transformers 系列的 checkpoint 都附带 config.json,其中若干字段组合可以构成一个高区分度的架构签名:

  • model_type
  • vocab_size
  • hidden_size
  • intermediate_size
  • num_hidden_layers
  • num_attention_heads / num_key_value_heads

由这些字段组成的 shape 元组(h · i · L · heads · kv)实质上代表了参考架构的指纹。研究者在实测中发现:

  • 某 7B 商用模型的 shape 完全匹配 Qwen2.5-7B
  • 某 72B 商用模型完全匹配 Qwen2.5-72B
  • 某 14B 视觉语言模型完全匹配 Qwen3-14B
  • 某 8B 模型完全匹配 Llama-3.1-8B
  • 某 MoE 模型完全匹配 DeepSeek-V3

单一字段的吻合没有说服力,但五维同时吻合即是强证据。

轴二:词表指纹(亲缘鉴定)

架构可能误导——一个模型可以照搬别家架构,却训练了全新词表;反之亦然。研究者通过 tokenizer.json 直接比对两个模型的词表集合,并以 min(|A|,|B|) 为分母计算最小重叠率:

  • 重叠率 ≈ 1.0:词表基本是父模型的子集,说明直接微调
  • 重叠率 ≈ 0.38:架构沿用 Qwen2.5-7B,但词表是全新训练的韩语词表,即「外国大脑、自己的语言」

这种基于最小集的归一化方式,能让从大词表中切出的子集词表正确地打出 ≈ 1.0 的高分。

轴三:权重指纹(最困难的一环)

权重指纹要回答的根本问题是:这些权重是从零预训练得到的,还是在某底座上继续预训练得到的?研究者在实践中遇到两个典型陷阱。

陷阱一:行向量余弦相似度几乎无用。 直观的想法是抽取 embed_tokens.weight,对共享 token 的行向量计算平均余弦相似度。但实测中,无论是已知从零训练的模型,还是已知的 Llama 衍生模型,余弦相似度都接近零。原因在于 Transformer 的隐藏空间没有「特权基底」,等价信息可以在任意正交旋转下编码;行向量余弦把旋转当成了差异。

陷阱二:线性 CKA 改善有限。 线性 CKA(Centered Kernel Alignment)具备旋转与各向同性缩放不变性,是比较表示空间的合适工具。从零训练的模型对候选底座的 CKA 接近 0,是干净的独立预训练证据;但一个继续预训练的衍生模型 CKA 仅约 0.25,与同家族两个无关模型之间的基线(约 0.21)差距很小。大规模训练对嵌入的重塑程度,足以让 CKA 在「是否派生」一侧失去判别力。

因此,研究者坦率地总结:权重轴可以可靠地确认「从零训练」(近零 CKA),但对「是否派生」并不是强检测器;架构与词表指纹仍然是主证据,权重只作为辅助。

实践与边界

Model Genome 团队已将同一套标尺应用于九家韩国机构的公开基座模型,并提供了 Model Genome Korea 的在线交互页面供读者自行验证。该方法的优势在于完全依赖 Hugging Face 等平台上的公开文件,不依赖模型卡片自述,因此对厂商披露质量参差不齐的开源生态具有现实意义。

与此同时,研究者也明确指出了方法的边界:config + tokenizer 指纹在「架构继承」层面有强证据力,但在「继续预训练 vs 从零训练」的细致区分上仍受限于权重比较工具的分辨能力。对于希望提升模型透明度的厂商与社区而言,这是一套可立即上手的轻量级验证框架;对于依赖模型血统判断合规与安全性的下游用户,它也提供了一个可复现的起点。

信源