研究论文
BDH-CQ:150M 参数模型在 ARC-AGI-1 打破成本–精度边界
研究者提出 BDH-CQ 循环潜在推理系统,1.5 亿参数配置在 ARC-AGI-1 达到 29.5% pass@2,单…
2026.08.15 · 周六约 2 分钟阅读
一篇名为 BDH-CQ 的研究在 Reddit r/MachineLearning 板块被作者本人贴出,宣称其推理系统在仅 1.5 亿参数的体量下,于抽象推理基准 ARC-AGI-1 上取得 29.5% pass@2 的成绩,并将单任务的计算开销压到约 0.00070 美元,从而突破了先前已报告的「成本–精度帕累托前沿」。对于关注高效推理与抽象泛化的研究者而言,这一组数字颇具吸引力。
系统思路:把记忆、适配与推理织成同一张网
BDH-CQ 的核心做法是把「上下文学习中的演示」与「查询时的推理」合并进同一套循环计算。具体而言:
- 推理时呈现的输入会持续更新模型的循环记忆(recurrent memory),相当于用演示直接「写入」模型状态。
- 查询到来后,模型在高维潜在空间中进行迭代计算,完成求解。
- 与常见的链式思维(Chain-of-Thought)类方法不同,中间推理状态不会被解码成自然语言,即模型不把每一步想法「说出来」。
作者强调,训练阶段不引入任务标识符,也不使用评估任务的演示对;推理时不更新任何参数。这意味着模型完全靠循环记忆和潜在空间的迭代来适配新任务,权重保持冻结。
关键数字:150M 参数 + 0.00070 美元 / 任务
研究给出的最具说服力的实验配置是 150M 参数版本:
- 在 ARC-AGI-1 基准上达到 29.5% pass@2。
- 单任务计算成本约 0.00070 美元。
- 在 ARC-AGI 已知的「成本 vs. 准确率」曲线上,该点位于此前报告的所有数据点构成的帕累托前沿之外,构成新的最优边界。
怎么看这条结果
BDH-CQ 的设计思路——「演示驱动循环记忆 + 潜在空间迭代求解 + 不外化中间步骤」——是抽象推理方向的一种相对小众但并不罕见的路线,此次的关键贡献在于把它打成了一个可量化的系统,并在 ARC-AGI 这一公认较难的基准上给出了具体的性价比坐标。
需要注意的是,目前可获取的信息仅为作者在 Reddit 自贴的摘要片段及其实验数字,尚无完整论文链接、作者机构、完整实验对照或消融研究的公开版本。对该结果稳健性的判断,仍有待同行评议、完整论文以及独立复现的进一步检验。
