桃子桃子快讯
返回首页
开源

EpistemeAI 开源 Reasoning-Medical-27B 医疗推理模型

基于 Qwen 27B 微调的医疗推理模型开源,采用 37 万条问答数据与 GRPO+Unsloth 训练流程。

2026.07.28 · 周二2 分钟阅读

AI 开源社区又迎来一款面向医疗领域的垂类模型。EpistemeAI 在 Hugging Face 上发布了 Reasoning-Medical-27B,这是一个基于 Qwen 27B 微调而来的推理模型,专注于专业医学、医学遗传学、生物学/医学本科课程以及临床知识等方向的问答任务。

模型定位与训练数据

Reasoning-Medical-27B 的目标是通用型医学推理,覆盖专业医疗知识、临床实践与生物医学基础等多个细分场景。据项目方介绍,该模型在包含约 37 万条高质量问答对的语料上完成微调,并引入了 Chain-of-Thought(思维链)推理机制,以提升在医学相关问题上的逐步推理能力。

  • 数据规模:约 37 万条问答样本
  • 推理增强:CoT 思维链
  • 训练框架:GRPO Trainer
  • 优化方法:Unsloth(用于高效微调)

训练方法

该项目采用 GRPO(Group Relative Policy Optimization)作为训练算法,并结合社区广泛使用的 Unsloth 优化库进行高效微调,这种组合在近期开源小模型的训练中较为常见,能够在保持效果的同时显著降低显存与计算开销。

资源与体验入口

整体来看,这是一款定位明确的垂类推理模型,社区可在 Hugging Face 上直接下载权重或试用 Demo;但目前公开信息中缺少标准医学基准(如 MedQA、PubMedQA)的评测数据,模型实际效果仍需使用者自行验证。

信源