桃子桃子快讯
返回首页
开源

SupraLabs 发布 500 万条推理语料,助力小型语言模型微调

SupraLabs 在 Hugging Face 开源 500 万条推理语料数据集,专为 5K 序列长度内的小模型 SF…

2026.07.24 · 周五2 分钟阅读

SupraLabs 在 Hugging Face 平台开源了一个名为 reasoning-corpus-4K-5M-v1 的大规模推理语料数据集,共包含 500 万条样本,专为在 5K 序列长度内对小型语言模型(SLM)进行监督微调(SFT)而设计。该数据集已在社区获得超过 1,000 次下载和 80 多个点赞。

数据集结构

每条样本包含以下字段:

  • repo_id:数据来源标识
  • tok_len:样本的 token 总长度
  • user:用户提示词
  • thought_trace:模型生成的思维链(chain-of-thought)推理过程
  • assistant:模型的最终回答
  • ChatML:将 user、thought_trace 和 assistant 整合为 ChatML 格式的版本

所有样本的序列长度均控制在 5K 以内,使其能够较好地适配小模型的微调需求,降低显存与算力门槛。

设计目的与适用场景

该语料的核心目标是帮助开发者将「推理 / 思维链」能力蒸馏到小型模型中。通过提供完整的 thought_trace 与 assistant 配对数据,微调者可以让小模型模仿大模型的逐步推理过程,从而在有限参数规模下获得一定的逻辑推理表现。这对于希望在端侧或低成本部署中复现推理能力的社区开发者具有参考价值。

社区反馈与获取方式

数据集托管在 Hugging Face 上,地址为 huggingface.co/datasets/SupraLabs/reasoning-corpus-4K-5M-v1,发布方 SupraLabs 的组织主页为 huggingface.co/SupraLabs。由于数据集由社区团队自行整理与发布,目前尚无公开的官方基准评测(benchmark)数据,其在下游任务上的实际效果仍需使用者自行验证。

注意事项

SupraLabs 并非主流大模型厂商或知名研究机构,数据质量、思维链的可信度以及是否存在噪声或重复样本,暂未在发布说明中详细披露。社区使用者在将其用于正式训练前,建议先抽样核查数据质量,并结合自身任务场景评估微调效果。

信源