桃子桃子快讯
返回首页
产品功能

Mind Lab 发布后训练平台 Mint Recursive 与 752B 模型 Macaron-V1.1

Mind Lab 推出后训练推理平台 Mint Recursive,并发布基于 GLM-5.3 后训练的 752B 模型…

2026.09.23 · 周三5 分钟阅读

Mind Lab 于近期正式发布面向行业的后训练与推理平台 Mint Recursive,并同步推出基于该平台训练完成的新一代模型 Macaron-V1.1。这家同时在做模型与基础设施(Infra)的公司,正把自己在持续学习领域积累的工程经验,沉淀为一套可对外交付的产品。

Macaron-V1.1:752B 参数、四个 2B LoRA 专家

Macaron-V1.1 是一个参数规模为 752B 的模型,由 744B 的基座模型与四个 2B 的 LoRA 专家模块组成。其基座来自 GLM-5.3,四个 LoRA 分别承担 Chat、Agent、Coding 与 Generative UI(生成式 UI)四种能力。

相比上一代 V1 中每个 LoRA 仅 1B 参数的设计,V1.1 把单个 LoRA 扩展到 2B,团队表示正在摸索更合适的专家参数规模。从 Benchmark 结果看,V1.1 在 6 个 Agent 榜单上相对 V1 全面提升,其中在 SWE-Marathon(超长程 AI 编程能力)任务上表现尤为突出。

值得注意的是,从 V1-Preview 到 V1 再到 V1.1,迭代周期在持续缩短:V1 到 V1.1 仅用了不到两周。Mind Lab 创始人陈锴杰透露,V1.1 是完全基于 Mint Recursive 训练完成的,这也是该平台首次完整支撑自有模型的迭代。

Mint Recursive:把后训练做成可递归的闭环

Mint Recursive 定位为「后训练 + 推理」一体化平台,工作流覆盖测评、数据、后训练与部署推理四个环节,并通过 API 与 Python SDK 暴露训练与部署能力。其架构由三大模块组成:

  • Train & Deploy(训练与部署):支持 SFT(监督微调)、RL(强化学习)、DPO(偏好训练)、全参微调等多种算法,兼容 GLM、Qwen、DeepSeek、Kimi、MiniMax 等多种尺寸的开源模型。
  • Env Hub(环境中心):定义 Agent 强化学习所需的数据集、验证器与状态,兼顾训练场与评测场。
  • Data & Experience(数据与经验):沉淀生产环境中的真实任务轨迹、反馈与偏好。

在工程实现上,平台用 LoRA 把训练与部署都做成 Serverless 模式,客户无需自购 GPU 或管理集群,可以按 Token 用量计费。四个 LoRA 专家模块对应的四个业务版本各自是轻量 Adapter,挂在同一基座上,互不干扰,可单独升级、上线、下线,历史版本可回溯;客户也可以把某个 Adapter 合并到基座中,得到完整的独立模型。

Mint Recursive 的核心思路是构建一个「数据 → 训练 → 部署 → 反馈 → 新数据」的闭环:模型在服务用户后积累真实任务轨迹,失败案例尤其有价值,平台定位问题与改进方案后,将其转为新训练数据,进而启动下一轮迭代。

行业背景:从做模型到做「后训练 Infra」

Mind Lab 切入后训练 Infra 并非孤例。当前业界正形成一个共识:万亿级模型的后训练工程难度极高,分布式训练的显存调度、训推一致性的精度对齐、异步 RL 的权重热更新,每一项都是硬骨头。智谱近期披露的案例中,其 GLM-5.3 驱动的 Infra Agent 已能自动优化自身的推理引擎,在超 10 万张国产芯片组成的集群上将端到端吞吐提升至初始基线的 3 倍。

海外市场中,Fireworks AI 作为对照:截至 2025 年 7 月,其估值达到 175 亿美元,ARR 突破 10 亿美元,日 Token 处理量超过 40 万亿;平台上 95% 以上的流量来自客户自己微调的专用模型,而非通用基座。

陈锴杰援引这一趋势指出:「通用大模型仅能覆盖各行业 20%–30% 的场景,剩下 70%–80% 的部分,都需要垂直持续学习来优化。」在他看来,AI 应用的竞争点正从产品本身转向「经验智能」——产品自身的判断、Taste、业务数据和对客户的理解,而这些资产只能来自真实生产环境。

三种交付方式

目前 Mint Recursive 提供三类服务:

  • 类似 FDE 模式,专家与企业共同完成训练;
  • 依托平台进行自动化训练;
  • 企业通过 API 与 Python SDK 自主训练。

陈锴杰也坦承,平台的「Recursive(递归)」目前还处于初级形态——人仍然在递归回路中,离模型全自动自训练仍有距离,但迭代方向已经明确:对企业客户而言,更重要的不是模型本身,而是企业手中独一无二的真实业务数据与一线现场。

信源