桃子桃子快讯
返回首页
产品功能

Fireworks AI 平台上线 DeepSeek V4 Flash 微调能力

Fireworks AI 宣布支持对 DeepSeek V4 Flash 进行监督微调、偏好微调及强化学习训练,面向编码…

2026.07.29 · 周三3 分钟阅读

AI 推理平台 Fireworks AI 近日宣布,其托管平台已正式上线对 DeepSeek V4 Flash 模型的微调支持,开发者可通过托管界面或 Training API 对该模型进行二次训练,使其适配具体的业务场景。这意味着 DeepSeek V4 Flash 不再仅作为推理模型使用,而是具备了完整的定制化训练通路。

微调能力概览

根据 Fireworks AI 在 X 平台发布的消息,平台目前为 DeepSeek V4 Flash 提供以下几类训练方式:

  • 监督微调(Supervised Fine-Tuning):通过标注数据对模型进行有监督的参数调整,是最常见的定制化手段。
  • 偏好微调(Preference Tuning):基于人类偏好数据对模型输出进行对齐优化。
  • 组合偏好优化(Combined Preference Optimization):将多种偏好信号合并,用于更细粒度的行为控制。
  • 强化学习(Reinforcement Learning):通过 Training API 提供,适用于更复杂的策略优化场景。

前三种方式可通过托管 UI 直接操作,强化学习则需要调用 Training API 完成,定位偏专业开发者。

适用场景

Fireworks AI 在公告中将 DeepSeek V4 Flash 的微调明确指向两类目标场景:

  • 编码智能体(coding agents):面向代码生成、自动化编程等需要较强代码理解与生成能力的智能体应用。
  • 高并发生产环境(high-volume production):服务于流量较大、对推理成本与延迟敏感的业务系统。

使用方式

Fireworks AI 表示,有意使用上述微调能力的团队需要通过官方渠道联系开通,并未在公告中披露具体的定价、计费方式或可用区域。平台也未在公开材料中提供 DeepSeek V4 Flash 微调后的 benchmark 数据或对比基线,因此实际效果仍需开发者自行验证。

总体而言,这是 Fireworks AI 在模型定制化能力上的一次扩展,将训练链路与其原有的推理服务进一步打通;对于已经使用 Fireworks AI 进行 DeepSeek 系列模型推理、又希望进一步控制模型行为的团队而言,降低了接入门槛。

信源