桃子桃子快讯
返回首页
开源

Scaffold CoT 开源:面向小模型的结构化推理数据集

开发者发布 Scaffold CoT 数据集,约 4M 样本,针对 5B 以下模型设计,采用固定三段式推理框架提升小模型…

2026.08.25 · 周二4 分钟阅读

一位独立开发者在 Reddit r/LocalLLaMA 发布了名为 Scaffold CoT 的开源思维链(CoT)数据集,规模约 400 万条样本、30 亿 tokens,专门针对参数规模在 50 亿以下的「小型模型」设计,旨在通过结构化框架降低自由式 CoT 在小模型上的不稳定问题。

数据集概况

该数据集托管于 Hugging Face(Specific-Labs/Scaffold-CoT),包含约 4M 条样本、约 3B tokens,其中单轮对话 3.07M 条,多轮对话 69.8 万条。每条样本最大长度限制在 2048 tokens,便于在普通消费级硬件上完成微调。开发者指出,自由式 CoT 在小型模型上往往带来更长、更混乱且错误率更高的输出,因此数据集的核心目标是用固定结构替换格式选择带来的不确定性,让模型把容量用于「思考内容」本身。

核心设计:三段式推理脚手架

每条样本都遵循同一套三段式结构,且顺序与字段不可更改:

  • Inventory(盘点):列出可用的工具、输入、约束条件与已知事实
  • Interaction(交互):分析这些要素如何相互影响
  • Execution(执行):逐步推导得出答案

格式的恒定使得正则表达式可以校验微调后模型的输出是否符合脚手架结构。深度则分四个层级,最深与最浅之间约 5.6 倍跨度,使模型学会「何时需要多想」而非始终在同一档位运行。

领域覆盖:18 个一级域、798 个子领域

数据集按 18 个一级域和 798 个子领域组织,每条样本均带明确的 domain / subdomain 元数据,可按需过滤,主要分布如下:

  • code:669,517 条 / 75 子领域
  • general:643,561 条 / 56 子领域
  • antihal:502,151 条 / 9 子领域
  • science:277,072 条 / 35 子领域
  • logic:258,697 条 / 21 子领域
  • strategy:223,119 条 / 141 子领域
  • business、creative、tool_use、tool_use_complex、selfcheck、writing_tone、longdoc、mathqual、format_strict、storytelling、steelman、antihal_kb_refined 等其余 12 个域合计约 120 万条

校准与自我纠错

开发者特别强调「校准(calibration)」模块:antihal、antihal_kb_refined 与 selfcheck 三块合计约 68.1 万条样本,覆盖模型识别知识边界、审计错误前提、推理中途自查并纠错的能力。其中 selfcheck 进一步细分为 12 类具体错误,例如 catch_logical_jump、catch_wrong_assumption、catch_unit_error、catch_correlation_causation、catch_premise_misread 等。

工具调用:87k 样本为真实执行结果

tool_use 与 tool_use_complex 合计约 27.9 万条工具调用样本,其中 87,162 条由真实执行的 harness 完成——调用工具后将真实返回结果回填到对话记录,模型只负责围绕真实结果撰写推理过程,因此「伪造工具输出」在结构上即不可能出现。这部分样本 100% 包含「失败 + 恢复」路径,平均每次会话 4.2 次工具调用。开发者也坦言,固定工具集的结构化输出会让工具结果文本呈现一定重复性。

适用与局限

数据集适合希望在消费级硬件上微调 5B 以下模型、用结构化 CoT 替代自由式 CoT 的研究者与开发者。其「topic-focused」分类方式区别于常见的「以数学、逻辑为主」的 CoT 数据集,更偏向通用任务能力。主要局限在于:工具结果文本存在重复、覆盖广度虽高但深度受限于 2048 tokens 的样本上限,且发布者为独立开发者,尚未经过第三方系统的 benchmark 评测,落地效果有待社区进一步验证。

信源