桃子桃子快讯
返回首页
研究论文

4B 模型能否靠验证框架替代规模?单人预注册实验给出有限答案

研究者用约 207 美元进行 23 项预注册实验,测试验证式推理框架在 Qwen3-4B 上的效果。

2026.08.21 · 周五4 分钟阅读

核心问题与实验设计

近日,Reddit 用户 u/retarded_770 在 r/MachineLearning 板块发布了一项单人预注册研究,探讨一个朴素但关键的问题:在 4B 参数级别的大模型上,结构化的「验证式推理框架」能在多大程度上弥补权重规模不足?研究者在 Qwen3-4B-Instruct-2507 之上叠加一个 LoRA,并在所有实验臂中使用同一组权重,预算约 207 美元,共完成 23 项预注册实验,每一项的成功门槛在花钱前已写入 runbook 并冻结。

该框架被称为「cube」,其工作流程为:模型抽取事实 → 代码逐条核验(数字须原文出现、词覆盖 ≥ 60%)→ 代码执行决定性算术 → 推理各阶段(约束判断 / 条件预测 / 选择 / 估计)仅以已验证事实为锚点 → 模板装配并做数字过滤。控制组包括同权重单次推理与官方推理增强版本 Qwen3-4B-Thinking-2507。裁判使用冻结的 Claude Sonnet 提示词,判定结果缓存,且从不写入训练数据。

严谨性保障

研究者在「盲化」上做了逐层加码:所有运行的成功门槛冻结;框架在 16 道保留测试题尚未生成前即完成 git 提交,题目由第三方模型(GPT)出题,作者与框架在出题后无任何接触;最后定下的对手也是在框架答案被裁判之后才选定,全部可在 commit 历史中回溯验证。

哪些假设被保留

  • 同权重下,框架在域内题上将干净通过率从 0/16 提升至 6/16,配对检验 p≈0.008。
  • 在第三方保留集、现实难度门槛下:框架 5/16、Thinking 版 2/16、单次推理 1/16,token 预算可比(每答 1,525 vs ≤ 1,360)。
  • 两项盲测约束保真度预测均得到验证。

哪些假设被证伪

  • 严格区间结果未能迁移到保留集(两臂均为 0/16),作者承认 6/16 主要源于自有题目生成器的偏差,外部审计在运行前已预判到此风险。
  • 双裁判有效性研究显示,缺陷检测一致性达 97.9%,但严重度排序依赖单一裁判,5–2 的差距因此带有限定条件。
  • 框架调用 5 次、单次仅 1 次,存在算力未对齐的混杂因子,下一步将做 best-of-5 + 污染锚点臂的匹配算力消融。
  • 全程 n=16,属存在性级别,作者已给出 Wilson 置信区间。

核心失败模式:跨阶段不一致

研究者在所有 4B 量级实验中都观察到同一类残余失败:「跨阶段不一致」——模型能正确指出约束,却在两步之后的选择中违反该约束。事实可以核验,但推理阶段之间的相互一致却无法保证。推理增强权重能降低发生率,但不改变失败类型本身。

完整记录与开放问题

作者已将 23 份 runbook、外部对抗审计的 8 条发现与处置、md5 封存的保留集与裁判缓存全部公开在 GitHub(cube-program)。其在文末向社区抛出三个问题:还有哪些未列出的有效性威胁?「跨阶段不一致」在文献中是否有其他名称?若再追加 10 美元,应优先做匹配算力消融还是把裁判席位升级到 14B?

整体而言,这是一项方法论严谨、结果保守的自下而上研究,结论指向「验证框架在小模型上有边际收益,但无法替代规模」,同时揭示了一类尚被低估的失败模式,值得同类研究者进一步追溯。

信源