开源
华佗GPT-3-27B 开源:基于 Qwen3.8 的医疗大模型采用单阶段 RL
FreedomIntelligence 开源华佗GPT-3-27B 医疗大模型,基于 Qwen3.8-27B,采用全新…
2026.09.25 · 周五约 2 分钟阅读
华佗GPT-3-27B(HuatuoGPT-3-27B)是由 FreedomIntelligence 团队开源的医疗领域大语言模型,基于通义千问 Qwen3.8-27B 构建,并采用了一种全新的单阶段策略优化(One-stage Policy Optimization,简称 OnePO)方法进行训练。团队同步开源了训练代码、医学强化学习数据集以及一个 8B 参数的评分模型(rubric grader)。
模型与 OnePO 训练方法
HuatuoGPT-3-27B 参数量为 270 亿,与一周前发布的 9B 版本构成系列互补。OnePO 是本次发布的核心技术亮点,其设计思路与常见的「SFT + RLHF」两阶段方案有明显差异,主要包含以下特点:
- 跳过传统的领域监督微调(SFT)阶段,直接通过强化学习让模型适配医学场景;
- 教师模型的回复仅作为临时引导信号,会随着模型能力提升而逐步「退役」;
- 整个适配过程被压缩在单一强化学习阶段内,简化了训练链路。
这一思路试图降低对高质量医学领域标注数据的依赖,让模型在探索式学习中直接形成医学推理能力。
开源资源一览
此次发布并非只放出权重,团队还同步开放了完整的训练配套资源:
- 训练代码:支持复现 OnePO 全流程;
- 医学 RL 数据集:用于强化学习阶段的奖励建模;
- 8B 评分模型(rubric grader):为强化学习提供奖励信号。
以上资源均已在 Hugging Face 平台公开,延续了华佗GPT 系列一直以来的开源传统。
系列背景与意义
华佗GPT 系列由 FreedomIntelligence 持续推进,专注于中文医疗场景的大模型研究。上周发布的 9B 版本主打轻量部署,本次 27B 版本搭配 OnePO 新方法,则为社区提供了一种不同于传统流程的医学大模型训练范式参考。对于关注医疗 AI、RL 训练方法以及开源中文模型的开发者与研究者来说,这是一次兼具工程资源与方法论参考价值的更新。
