开源
EpistemeAI 开源 Reasoning-Medical-27B 医疗推理模型
基于 Qwen 27B 微调的医疗推理模型开源,采用 37 万条问答数据与 GRPO+Unsloth 训练流程。
2026.07.28 · 周二约 2 分钟阅读
AI 开源社区又迎来一款面向医疗领域的垂类模型。EpistemeAI 在 Hugging Face 上发布了 Reasoning-Medical-27B,这是一个基于 Qwen 27B 微调而来的推理模型,专注于专业医学、医学遗传学、生物学/医学本科课程以及临床知识等方向的问答任务。
模型定位与训练数据
Reasoning-Medical-27B 的目标是通用型医学推理,覆盖专业医疗知识、临床实践与生物医学基础等多个细分场景。据项目方介绍,该模型在包含约 37 万条高质量问答对的语料上完成微调,并引入了 Chain-of-Thought(思维链)推理机制,以提升在医学相关问题上的逐步推理能力。
- 数据规模:约 37 万条问答样本
- 推理增强:CoT 思维链
- 训练框架:GRPO Trainer
- 优化方法:Unsloth(用于高效微调)
训练方法
该项目采用 GRPO(Group Relative Policy Optimization)作为训练算法,并结合社区广泛使用的 Unsloth 优化库进行高效微调,这种组合在近期开源小模型的训练中较为常见,能够在保持效果的同时显著降低显存与计算开销。
资源与体验入口
- 模型权重:https://huggingface.co/EpistemeAI/Reasoning-Medical-27B
- 在线 Demo:https://huggingface.co/spaces/EpistemeAI/reasoning-medical-27b
整体来看,这是一款定位明确的垂类推理模型,社区可在 Hugging Face 上直接下载权重或试用 Demo;但目前公开信息中缺少标准医学基准(如 MedQA、PubMedQA)的评测数据,模型实际效果仍需使用者自行验证。
