桃子桃子快讯
返回首页
工具

独立工程师提出「蓝图蒸馏」框架,欲降低 Kimi K3 2.8T 压缩实验成本

退休工程师设计 BSP-Structured Expert Consolidation 方案,把昂贵教师模型分析做成可复…

2026.07.27 · 周一3 分钟阅读

近日,Reddit 论坛 r/LocalLLaMA 用户 /u/Ok-Shower7286 公开了一项名为「Blueprint Distillation(蓝图蒸馏,BPD)」的模型压缩设计方案。该方案的目标是把 2.8T 级别 MoE 教师模型(如 Moonshot AI 的 Kimi K3)的分析阶段与下游压缩阶段解耦,通过生成可复用的「压缩蓝图(Compression Blueprint)」中间表示,降低多次压缩实验的总体算力开销。

核心思路:把教师模型分析做成「编译器前端」

作者将传统压缩流程「Teacher → Analysis → 27B Student」重构为两阶段:

  • 第一阶段:对 2.8T 教师模型执行高成本 profiling 分析,输出可持久化的 Blueprint 中间表示,包含专家共激活、敏感性、相似度与依赖关系等信息,并附带预算相关视图。
  • 第二阶段:以 Blueprint 为输入,针对不同目标规模(27B / 7B / 3B)分别生成对应的学生模型,无需重复执行昂贵的 profiling。

作者表示,Blueprint 本身借鉴了 Taylor saliency、Fisher 式剪枝、专家聚类、依赖分析等已有技术,并非提出全新剪枝算法;其创新点在于把这些信息组织成「可检查、可复用、可持久」的中间产物,使切换目标规模时无需「从头再来」。

第一个具体目标:Kimi K3 → 27B

作者将 Moonshot AI 的 Kimi K3(2.8T MoE)作为首个真实落地目标,计划生成一份 Blueprint.json 来验证设计是否可行。这一步需要在分布式 K3 部署上采集路由与共激活数据,并配合校准语料运行 profiling。作者强调,该思路并不局限于 K3 本身,理论上可推广到其他大型 MoE 教师模型。

现状与诉求

需要指出的是,作者明确表示这只是一份设计草案,尚未产出任何实际压缩结果。当前面临的主要瓶颈是缺乏 H100 / H200 级别算力,无法完成首次 Blueprint 生成所需的 profiling 运行。

作者在帖子中明确了两点诉求:

  • 征求对架构设计的技术反馈;
  • 寻找拥有 H100 / H200 算力、愿意合作完成首次 profiling 的同行。

相关设计文档已发布在 GitHub 仓库 github.com/edwardyoon/BSEC,供感兴趣的研究者审阅。

信源