独立工程师提出「蓝图蒸馏」框架,欲降低 Kimi K3 2.8T 压缩实验成本
退休工程师设计 BSP-Structured Expert Consolidation 方案,把昂贵教师模型分析做成可复…
近日,Reddit 论坛 r/LocalLLaMA 用户 /u/Ok-Shower7286 公开了一项名为「Blueprint Distillation(蓝图蒸馏,BPD)」的模型压缩设计方案。该方案的目标是把 2.8T 级别 MoE 教师模型(如 Moonshot AI 的 Kimi K3)的分析阶段与下游压缩阶段解耦,通过生成可复用的「压缩蓝图(Compression Blueprint)」中间表示,降低多次压缩实验的总体算力开销。
核心思路:把教师模型分析做成「编译器前端」
作者将传统压缩流程「Teacher → Analysis → 27B Student」重构为两阶段:
- 第一阶段:对 2.8T 教师模型执行高成本 profiling 分析,输出可持久化的 Blueprint 中间表示,包含专家共激活、敏感性、相似度与依赖关系等信息,并附带预算相关视图。
- 第二阶段:以 Blueprint 为输入,针对不同目标规模(27B / 7B / 3B)分别生成对应的学生模型,无需重复执行昂贵的 profiling。
作者表示,Blueprint 本身借鉴了 Taylor saliency、Fisher 式剪枝、专家聚类、依赖分析等已有技术,并非提出全新剪枝算法;其创新点在于把这些信息组织成「可检查、可复用、可持久」的中间产物,使切换目标规模时无需「从头再来」。
第一个具体目标:Kimi K3 → 27B
作者将 Moonshot AI 的 Kimi K3(2.8T MoE)作为首个真实落地目标,计划生成一份 Blueprint.json 来验证设计是否可行。这一步需要在分布式 K3 部署上采集路由与共激活数据,并配合校准语料运行 profiling。作者强调,该思路并不局限于 K3 本身,理论上可推广到其他大型 MoE 教师模型。
现状与诉求
需要指出的是,作者明确表示这只是一份设计草案,尚未产出任何实际压缩结果。当前面临的主要瓶颈是缺乏 H100 / H200 级别算力,无法完成首次 Blueprint 生成所需的 profiling 运行。
作者在帖子中明确了两点诉求:
- 征求对架构设计的技术反馈;
- 寻找拥有 H100 / H200 算力、愿意合作完成首次 profiling 的同行。
相关设计文档已发布在 GitHub 仓库 github.com/edwardyoon/BSEC,供感兴趣的研究者审阅。
