产品功能
Fireworks AI 平台上线 DeepSeek V4 Flash 微调能力
Fireworks AI 宣布支持对 DeepSeek V4 Flash 进行监督微调、偏好微调及强化学习训练,面向编码…
2026.07.29 · 周三约 3 分钟阅读
AI 推理平台 Fireworks AI 近日宣布,其托管平台已正式上线对 DeepSeek V4 Flash 模型的微调支持,开发者可通过托管界面或 Training API 对该模型进行二次训练,使其适配具体的业务场景。这意味着 DeepSeek V4 Flash 不再仅作为推理模型使用,而是具备了完整的定制化训练通路。
微调能力概览
根据 Fireworks AI 在 X 平台发布的消息,平台目前为 DeepSeek V4 Flash 提供以下几类训练方式:
- 监督微调(Supervised Fine-Tuning):通过标注数据对模型进行有监督的参数调整,是最常见的定制化手段。
- 偏好微调(Preference Tuning):基于人类偏好数据对模型输出进行对齐优化。
- 组合偏好优化(Combined Preference Optimization):将多种偏好信号合并,用于更细粒度的行为控制。
- 强化学习(Reinforcement Learning):通过 Training API 提供,适用于更复杂的策略优化场景。
前三种方式可通过托管 UI 直接操作,强化学习则需要调用 Training API 完成,定位偏专业开发者。
适用场景
Fireworks AI 在公告中将 DeepSeek V4 Flash 的微调明确指向两类目标场景:
- 编码智能体(coding agents):面向代码生成、自动化编程等需要较强代码理解与生成能力的智能体应用。
- 高并发生产环境(high-volume production):服务于流量较大、对推理成本与延迟敏感的业务系统。
使用方式
Fireworks AI 表示,有意使用上述微调能力的团队需要通过官方渠道联系开通,并未在公告中披露具体的定价、计费方式或可用区域。平台也未在公开材料中提供 DeepSeek V4 Flash 微调后的 benchmark 数据或对比基线,因此实际效果仍需开发者自行验证。
总体而言,这是 Fireworks AI 在模型定制化能力上的一次扩展,将训练链路与其原有的推理服务进一步打通;对于已经使用 Fireworks AI 进行 DeepSeek 系列模型推理、又希望进一步控制模型行为的团队而言,降低了接入门槛。
