桃子桃子快讯
返回首页
工具

DeepSeek V4 Flash 0731 上线 Together AI,支持 SFT 与 DPO 微调

Together AI 宣布支持对 DeepSeek V4 Flash 0731 进行微调,可通过 SFT 或 DPO…

2026.08.12 · 周三2 分钟阅读

Together AI 在 X 平台发布消息,DeepSeek V4 Flash 0731 现已可在其平台上进行微调,并支持将微调后的模型直接部署在该平台进行生产环境推理。该功能面向希望针对特定业务场景定制模型行为的开发者与团队。

支持的微调方式

Together AI 提供的微调流程覆盖两种主流方法:

  • SFT(Supervised Fine-Tuning):使用标注数据对模型进行监督式训练,适合建立任务专属的行为模式。
  • DPO(Direct Preference Optimization):基于偏好对比数据训练,使模型输出更贴近用户期望的取向。

两种方法均可在 Together AI 的托管环境中完成,用户无需自行搭建训练基础设施。

可定制的应用方向

Together AI 在公告中给出了几个典型的微调场景示例:

  • 代码生成与补全:通过代码语料微调,强化模型在特定语言或框架下的表现。
  • 工具调用(tool use):让模型更稳定地按格式调用外部 API 或函数。
  • 垂直领域适配:针对企业内部数据微调,使模型掌握专业术语与业务逻辑。

完成微调后,用户可在同一平台直接部署并对外提供推理服务,无需切换厂商或自行运维 GPU 资源。

几点注意

该公告仅为 Together AI 一方的功能上线通知,原文未披露 DeepSeek V4 Flash 0731 的具体参数规模、上下文长度、与既有 DeepSeek 模型的性能对比等细节,也未给出基准测试数据。名称中的「V4 Flash」与 DeepSeek 此前惯用的命名体系存在差异,平台是否对其进行了额外封装或量化处理,公告中未做说明。如需评估该模型在生产环境中的实际表现,建议参考 DeepSeek 官方发布渠道与 Together AI 后续的技术文档。

信源