arXiv 研究:九款 3B 以下开源模型系统评测,小模型经微调可胜任本地化结构化任务
论文构建 1085 题、16 主题基准,评估 135M–3B 开源模型,Qwen Coder 3B 以 75.67% 居…
arXiv 上的一项新研究把焦点放在了 30 亿参数以下的开源小模型上,试图回答一个与「前沿大模型」不同的问题:在普通机构可承受的硬件与治理约束下,能否系统地筛选、可审计地微调并部署一批「够用」的小模型,用于结构化的本地任务。论文通过一次受控实验,给出了较为完整的答案。
研究设计:自定义基准与统一微调流程
研究者构建了一个包含 1085 道选择题、覆盖 16 个主题的基准,专门面向「结构化本地部署」场景。题目设计强调四项能力:符号精度、约束格式、抽取能力,以及短程语义判断。所有题目要求模型以「单字母」协议输出,便于自动评分与一致性比较。
被测模型共 9 款,均为开放权重,参数规模跨度从 1.35 亿到 30 亿(135M–3B)。在此基础上,研究者设计了一条共享的参数高效微调(PEFT)流水线:采用 4-bit NF4 量化,配合 DoRA / LoRA 风格适配器,在 NVIDIA L4 级算力预算下完成适配。
基座评测:Qwen Coder 3B 领先
在基座模型直接评测中,Qwen Coder 3B 以 75.67% 的严格准确率排名第一,显著高于其他候选模型:
- Qwen Coder 3B:75.67%
- Qwen2.5 1.5B:67.10%
- Qwen3.5 2B:64.98%
- Granite 3.3 2B:64.61%
结果呈现出明显的「规模—能力」梯度,但同时也表明,在结构化任务上,专门化的代码模型(如 Qwen Coder 3B)可以在远低于通用前沿模型的参数量下取得相对领先的表现。
微调收益:108 题留出集上的明显提升
在共享的 108 题留出微切分上,统一 PEFT 流程带来的准确率提升如下:
- Qwen Coder 3B:+26.85 分
- SmolLM2 1.7B:+25.92 分
- Qwen2.5 1.5B:+19.44 分
- SmolLM2 360M:+10.18 分
- SmolLM2 135M:+5.55 分
提升幅度与基座规模呈正相关,但即便是 135M 级别的极小模型,也能从同一套低成本的微调流程中获益,说明 PEFT 对超小模型并非「无效」。
多维度结论:流程纪律比模型规模更关键
论文在排名、主题异质性、难度分层、失败构成、效率前沿以及主题条件迁移六个维度展开分析后,给出了一个反复出现的结论:只要遵循「基准构建 → 跨模型评测 → 低成本特化」这一纪律化工作流,一批 3B 以下的开源模型即可作为「本地专家」,胜任结构化的细分工作负载,而无需追求前沿规模的通用能力。
对于希望在本机或私有环境中低成本落地语言模型能力的机构与开发者,这项研究提供了一条可复制的评估—微调路径。
