桃子桃子快讯
返回首页
工具

Mind Lab 推后训练平台 Mint Recursive,752B 模型两周迭代一次

Mind Lab 发布基于 GLM-5.3 的 752B 模型 Macaron V1.1,并推出面向企业的后训练平台 M…

2026.09.24 · 周四4 分钟阅读

围绕开源大模型的第三方后训练平台,正在成为 AI 行业新的竞争焦点。海外已有 Thinking Machines Lab 的 Tinker、Fireworks、Together AI、Prime Intellect 等多家公司入局,而国内专门做这一方向的独立平台并不多。近期,Mind Lab 发布了其面向企业的后训练与推理平台 Mint Recursive,并同步推出基于 GLM-5.3 的 Macaron V1.1 模型,试图切入这一赛道。

模型与基准表现

Macaron V1.1 是一款 752B 参数的模型,由 GLM-5.3 的 744B 基础权重与四组各约 2B 的 LoRA 组成,分别承担 Chat、Agent、Coding 与生成式 UI 四类任务。Mind Lab 公布的测试结果显示,V1.1 在全部 7 项评测中得分超过原始 GLM-5.3,并在第三方榜单 DeepSWE v1.1、SWE-Marathon、AutomationBench 上追平或超越 Opus 5。

在长程 Coding 任务中,V1.1 将 SWE 轨迹标准化为复现、定位、编辑、验证、恢复五个阶段,减少了低相关度探索轮次,从而以更少的步骤与 Token 完成同一任务。在复杂办公场景中,V1.1 强化了工具调用的安全边界,要求模型不仅懂得如何调用工具,也要知道何时不应动手,避免越出用户意图与授权范围。

平台机制

Mint Recursive 将一次模型更新拆解为评测、数据准备、训练、复测与部署几个环节,让后训练沿可复用的流程反复进行。

  • 建立 Benchmark:企业先基于自身业务定义任务与标准,平台让基座模型跑一轮评测并保存失败轨迹。
  • 数据准备:可使用既有数据,也可根据失败轨迹构造新样本。
  • 训练方法:支持 SFT、DPO 与强化学习,提供 LoRA 与全参数更新两种规模选择。
  • 复测与部署:新版本可直接上线,回归同一 Benchmark 检验,生产环境中暴露的问题还能回流为下一轮训练材料。

平台支持 GLM、Qwen、DeepSeek、Kimi、MiniMax 等开源模型系列,并提供 FDE 专家共同训练、平台自动化训练与企业自主训练三种合作方式。

商业化与教育路径

Mint Recursive 将价值拆为四个层次:低门槛、高性价比、可持续迭代与高自由度。

  • 低门槛:金融、AI for Science、医疗等 AI 化程度较高的行业,已积累内部题库与业务规则,可直接作为 Benchmark 起点。
  • 高性价比:专项模型训练服务最低 1000 美元起;不同 LoRA 可共享同一常驻基座,训练与部署按使用量计费。
  • 可持续迭代:每个 LoRA 可单独训练、评测、上线与撤回;旧 LoRA 可能随基座升级过期,但企业的评测与数据资产可以延续。
  • 高自由度:支持全参数训练与自定义 Loss,可通过 Python SDK 将 verl、TRL、OpenRLHF 或 PyTorch 训练代码迁移进来。

平台背后是 Mind Lab 自 2025 年起在 Kimi K2 等万亿参数模型上积累的 Infra 能力,包括超大模型在大量 GPU 上的拆分训练、生成与训练路径一致的异步训练、LoRA 热更新等,相关能力已接入 Megatron-Bridge、VERL、AReaL 等主流生态。

从应用到实验室再到企业服务

Mind Lab 的前身团队最初以个人 Agent 产品 Macaron 起家,关注个人记忆与个性化服务;之后成立实验室,训练自有模型 Macaron V1;如今又把训练模型的系统打包为 Mint Recursive,开始对外服务企业客户。

服务自身产品与服务外部企业是两件不同的事。做 Macaron 时,团队清楚目标并能持续调整方案;面对企业客户,任务、数据、预算都在变化,客户也可能尚未明确希望模型达成什么效果。能否用同一套能力稳定解决他人问题,将决定 Mint Recursive 能走多远。

信源