研究论文
4B 开源模型逼近 o3 水平:瑞典医师执照题实测
实验显示 Gemma4-E4B、Qwen3.5-4B 在零样本下即可达 77%,开启推理后逼近 o3 的 88%。
2026.07.26 · 周日约 2 分钟阅读
4B 参数量级的开源模型在瑞典国家医师执照考试多选题(MedQA-SWE)上,仅需轻量后训练或直接开启推理,就能逼近 OpenAI o3 的水平。Reddit 用户 AccomplishedCat4770 公开了实验结果、训练代码与详细博客,展示开源生态在医疗垂直领域的能力跃升。
基准与对比对象
实验数据集为 MedQA-SWE,研究者使用前一年数据进行监督微调(SFT),最终在独立年份的考试题上评测。参照系方面,GPT-4 在 2024 年相关子集上取得 84% 准确率,o3 在 2025 年取得 88%,后者被视作当前的天花板。
关键准确率数据
- MedGemma-1.5-4B:经过 SFT 后训练,最终年份考试准确率 60%,刚好达到及格线。
- Gemma4-E4B 与 Qwen3.5-4B:仅晚 MedGemma 约三个月发布,零样本(无任何后训练)即达 77%。
- Qwen3.5-4B 开启推理模式:准确率提升至 87%,与 o3 几乎持平。
推理截断与 S-GRPO 干预
当不设推理长度上限时,模型有时会陷入重复格式调整的循环,直到占满整个上下文窗口也未给出答案。研究者采用了 S-GRPO 论文中提出的「early exit」方案:在预设序列长度处注入一段提示短语并主动关闭思考过程,问题随之得到收敛。作者也试过该论文的强化学习方法来缩短推理轨迹,但训练规模偏小,收益有限。
一个反直觉的现象
Qwen3.5-4B 即便输入为瑞典语提示、问题与选项,全程仍以英语进行内部推理。这一现象与「瑞典语在 LLM 训练语料中仅占约 1%」的常见估计形成对比,说明在该模型训练配比下,跨语言推理并未受到明显制约。
复现资源
- 训练代码:https://github.com/tarolangner/medqaswe_medgemma_sft
- 详细博客:https://tensorlabbet.com/2026/07/19/medqaswe_post_training/
整体看,这一结果提示对特定垂直领域而言,4B 级开源模型在合理提示策略或少量微调后,已具备替代更昂贵闭源模型的潜力,但样本仍局限于瑞典语医学考试这一窄场景。
